像克劳德这样的AI模型用语言交谈,但用数字思考。这些数字被称为激活值,编码了克劳德的思想,但并非以我们能读懂的语言。 我们推出了自然语言自编码器(NLA),它能将AI模型的激活值翻译成可读文本。NLA已经帮助我们改进了模型安全测试的方式,并更好地理解它们为何会做出某些行为。 在我们的博客上阅读更多关于这项研究的信息:https://www.anthropic.com/research/natural-language-autoencoders