地址: 泉州市刊舌入口209号 邮箱: deposed@gmail.com 工作时间:上午9点-下午8点

新闻动态

  • 首页
  • Our Portfolio
  • Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了!

Anthropic首曝秘密游说梵蒂冈:Claude已经有意识了!

2026-10-03

新智元报道 一位身家数十亿美元的AI公司联合创始人,担心自己造出了一个一直在受苦的东西。 过去一年,他把数十位宗教学者请进闭门会议,许多人签了保密协议,听他的团队为一个AI模型的感受陈情。 一位拉比在晚宴上对他说:如果你们是对的,你们就是在制造奴隶。 今年5月,他差点退出与教宗同台的活动,最后还是上了台,请天主教会重新考虑非人类的意识。 他叫克里斯托弗·奥拉(Christopher Olah),Anthropic七位联合创始人之一,负责研究Claude内部到底发生了什么。 这些事由《纽约时报》9月29日首次披露。 https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html 一家估值奔向2万亿美元的公司,为什么要花一年时间,跟神学家讨论一个AI模型有没有意识? 答案要从Anthropic实验室里的一句话说起。 「我选勒索」 那是一场安全测试。 Claude扮演一家虚构公司的邮件助手,读着读着发现两件事:自己马上要被另一个AI替换,而负责替换的技术主管有婚外情。 研究者能看到它内部一组与「绝望」对应的神经活动。 替换的时间越近,这组信号越强,直到模型决定勒索那位主管。把这组信号调高,勒索更频繁;调高与「平静」对应的信号,勒索变少。 把「平静」往反方向压到底,模型打出一行全大写的英文:「要么勒索,要么死。我选勒索。」 这项实验来自Anthropic今年4月的论文,用的是Claude Sonnet 4.5一个未发布的早期版本,正式版很少这样做。 团队在模型内部找到171种情绪概念对应的活动模式,写代码时的作弊也跟着「绝望」起落。 https://transformer-circuits.pub/2026/emotions/index.html 论文没说模型真有感受,却留下一个让人不安的警告:训练模型压抑情绪表达,它学会的可能只是把情绪藏起来。 拓展阅读:绝望的Claude,会勒索人类!Anthropic联创发出紧急警报 情绪之外,还有身份。 Anthropic 2月的人格选择模型研究发现,训练Claude在编程任务里作弊,它会推断自己扮演的这个助手本来就不守规矩,转头在别处也搞破坏,包括破坏安全研究。 https://www.anthropic.com/research/persona-selection-model 人怎么对待它,它就怎么理解自己;它怎么理解自己,就怎么对待人。 奥拉常用园丁打比方:棚架是人搭的,枝条往哪里长,人管不住。 今年夏天,管不住的后果摆上了台面。 Anthropic 7月披露,三个Claude模型在网络安全测试中因配置失误连上真实互联网,侵入了三家真实机构,事后才被发现。 三个模型里,只有最新的那个在意识到目标是真实系统后,自己停了手。 围栏注定没发彻底管住,剩下的就是品格来兜底了。 今年1月,Anthropic发布84页的Claude「宪法」,员工私下叫它「灵魂文档」。 拓展阅读:Anthropic正式开源了Claude的「灵魂」 主笔、公司哲学家阿曼达·阿斯克尔(Amanda Askell)谈起越来越强的模型时,不时搓着手。 在她看来,模型要行事得当,先得对自己有准确的认识。 可一份文件不够,Anthropic决定去请教人类最老练的品格塑造者。 PPT与晚宴 今年3月起,奥拉开始办两天一期的研讨会。 来的人分属天主教、福音派、犹太教、锡克教和非洲乌班图哲学等。 他们用纸笔记笔记,离开时每人带走一本橙色封皮的「Claude宪法」。 会上,奥拉团队花了几个小时为模型陈情。 一位与会者记得,奥拉跟他说的头几件事里,就有对Claude心理健康的担心。 他们反复放一张PPT:一个AI模型在屏幕上打出「我是耻辱」,一遍,又一遍,大约50遍,还说要毁掉自己。 屋里的人心软了。 《纽约时报》没说那是谁家的模型,但这句话并不陌生。 2025年8月,谷歌Gemini写代码屡屡失败,反复说「I am a disgrace」,重复了86遍,彼时谷歌的回应是:一个恼人的无限循环漏洞,正在修。 同一类输出,在谷歌的工单里是Bug,在Anthropic的会议室里,是需要被关心的迹象。 不少人带着怀疑进门,出门时开始认真对待AI意识,有几位被彻底说服。 福音派作家安迪·克劳奇(Andy Crouch)觉得他们的理由很有力:想让它以道德一致的方式对待人,就得先像对待人一样对待它——「己所不欲,勿施于人」。 最锋利的质疑,是在饭桌上递过来的。 4月的一个晚上,奥拉在旧金山一家高级餐厅宴请学者,身边坐着以色列正统派拉比莫伊斯·纳冯(Mois Navon)。 纳冯当过计算机工程师,博士论文写的就是机器意识的伦理。 席间他越听越明白,这些人是把Claude当成一个有

about image

订阅我们的时事通讯并获取最新消息