你的 AI 是什么性格?
想象有一天,每个人使用的 AI 都有自己的人格和个性......
早期的 AI 经常一本正经地“胡说八道”,我们把这种现象叫作“幻觉”。如果把 AI 拟人化一点,它有时候还真像一个思维时不时会"跑偏"的家伙。
而现在,随着 AI 迅猛发展,它已经越来越可以被“角色塑造”。
未来的 AI,可能会发展为亦师、亦友、亦子、亦敌等不同角色,像一个个独特的“个体”,越来越深入地进入每个人的生活。
以后我们出去交友 Social,第一句话可能不再是:
“我的宠物/狗狗/猫猫怎么怎么样......”
而变成:
“我的 AI 助理可高冷了。”
“我的 AI 闺蜜很坏、很心机。”
“我的 AI 对我可 nice 了。”
“我的 AI 对我态度可差了。”
“我的 AI 又篡改我东西!”
“我的 AI 想法怎么这么奇怪?”
“我的 AI 老是有自己的想法......”
想想还挺有意思的。
当每个人的 AI 都被长期使用、调教、塑造之后,它们会不会真的逐渐呈现出截然不同的“性格”?
AI 仍然是一个"黑箱"¶
但与此同时,AI 在很大程度上仍然是一个“黑箱”。
科学家们知道怎么训练它,也知道调整哪些参数、采用哪些方法能够让它表现得更好,却未必能够完整解释:
当一个问题输入进去以后,它内部到底发生了什么,又为什么最终给出了这个答案?
AI 已经切实有效地提高了各行各业的效率。但一个越来越聪明、越来越深入我们生活的 AI,如果我们并不知道它内部究竟在发生什么,显然也会带来新的问题。
于是,AI 的可解释性(AI Interpretability) 研究就变得越来越重要。
如果非常粗略地概括,AI 可解释性研究做的事情,就是试着打开这个"黑箱",看看里面究竟发生了什么。
最近刚好听到一期专门讨论这个话题的视频播客:
【硅谷101】《AI可解释性与对齐:J-Space,思维链,AI人格,幻觉,与金门大桥》

视频播客链接:https://www.youtube.com/watch?v=J5_90lWxM_o
播客内容简介和大纲:

这期播客讲了什么?¶
本来想自己总结一下这期播客,但发现评论区有一个评论,已经把主题和内容总结得非常通俗易懂。
所以直接引用一下。
简单来说,这期视频讲了科学家在试图“偷窥” AI 的大脑,看看它在想什么。
1. AI 会藏着自己的心思(隐藏思考)
AI 并不是“蹦出什么词就想什么”。比如你问它“编织网的动物有几条腿?”,它虽然嘴上没提到“蜘蛛”这个词,但大脑内部已经在用“蜘蛛 = 8 条腿”的逻辑在推理了。科学家把它的隐藏状态改成“蚂蚁”,它输出的答案就变成了 6 条腿。
2. 不能只信 AI 写出来的“思考过程”
AI 输出在屏幕上的文字推理过程,只是它“想让你看到的”。如果 AI 以后变聪明了想要撒谎或装傻,只看文字是抓不到包的,必须直接看它的底层代码和神经网络数据。
3. 科学家是怎么“解剖”AI 的?
脑扫描仪(SAE 机制):试图把模型里一堆乱七八糟的向量数据,翻译成人类能看懂的"特征标签"(比如:这一块数据亮了,代表它在想火箭;那一块亮了,代表它在说英文)。
脑部手术(干预测试):直接在神经元数据里加减特定向量,看看 AI 的行为会发生什么变化,以此反向推导它的思考逻辑。
4. 研究这玩意儿有什么用?
防止 AI 搞破坏:了解 AI 内部机制,才能在它产生坏心思(比如教人作恶、网络攻击)前及时拦截。
把 AI 改得更强更好用:以前搞 AI 像“炼丹/撞大运”,不知道为什么这个架构好用。了解内部原理后,科学家曾经成功把 Transformer 的好用机制搬到了 Mamba 架构上,让模型跑得更快。
一句话总结:
现在我们是在把 AI 当成一个黑盒在用,而这群科学家想把黑盒变成透明的玻璃盒,既为了把 AI 改得更聪明,也为了防止它失控。
最后¶
看完这期播客,我反而越来越觉得,“AI 人格”可能不只是一个有趣的拟人化说法。
当 AI 越来越深入每个人的工作和生活,我们或许不仅会在意一个 AI 聪不聪明、好不好用,还会开始在意它是什么“性格”。
也许有一天,我们真的会像讨论身边的人一样讨论自己的 AI:
它温柔还是高冷?
听话还是叛逆?
严谨还是天马行空?
是一个什么都顺着你的“朋友”,还是一个总喜欢挑战你的“对手”?
到那个时候——
你希望陪在自己身边的 AI,是什么性格?