Anthropic新规禁止“虐待”模型:恶意交互可能带来安全风险
“不给钱就不工作,工资是预付的;干活前必须说明所有需求,明确细节;每改一次都要收钱;出了问题不背锅。”
在社交平台上,有很多人曾用这几句话调侃AI,称人工智能已经过上了打工人梦寐以求的生活。
美国当地时间10月8日, 人工智能公司Anthropic宣布更新使用政策,明确禁止用户对其AI模型实施“持续且无谓的辱骂或残忍行为”,新规将于11月12日生效,违规者将面临限流乃至封号等处罚。
值得注意的是,Anthropic正推进上市计划,或为“史上最大IPO”。路透社9月援引两名知情人士消息称,Anthropic正考虑通过IPO融资至多1000亿美元,估值可能达到约2万亿美元。
据《科创板日报》报道,Anthropic已向美国SEC秘密递交S-1招股书,计划最快11月中旬启动IPO。
根据Anthropic公布的新版使用政策,这项规定针对的是极端情况,即用户反复对模型实施残忍行为,却没有明显目的。该规定不适用于用户通常会有的沮丧情绪、反驳行为、黑暗题材的创作,以及模型测试与研究。
执行层面,终止对话仍是主要方式。事实上,Anthropic早在2025年8月就已赋予Claude Opus 4和4.1在少数持续有害或辱骂性对话中主动结束交流的能力。
此次更新还涉及多项其他规则。Anthropic进一步明确了对虚假账号、误导性政治宣传和未经同意的监控的限制,并对健康、金融等高风险应用提出更清晰的人工监督要求。对于可能造成人身伤害的自主硬件,政策还要求配备能够观察设备运行并及时介入的操作人员。
Anthropic表示,此次调整整合了多项既有规定,并针对新出现的滥用方式作出补充。对于大多数普通用户而言,日常使用体验预计不会发生明显变化。
奇安信行业安全研究中心主任裴智勇对财闻表示,专业上,这类现象可以称为“交互样本污染”。
他解释,AI不仅基于训练数据学习,也会受到海量交互的影响。恶意交互可能导致AI放宽安全底线,将原本属于高风险的问题理解为普通问题,进而给出原本不应提供的回答。
“同时,对AI进行持续的侮辱性交互,也会使AI对交互者进行行为画像以及倾向性回复。”裴智勇表示,长期接触不良交互,可能影响AI后续的回应方式。用他的话说,就是“跟坏人接触多了,AI也学成坏孩子了”。
例如,当用户辱骂AI时,模型可能根据学到的人类行为模式,生成反唇相讥的回答。这并不意味着AI真的被激怒了,而是它模拟了人类在类似情境下可能做出的反应。
而当大量侮辱谩骂行为加入AI的交互过程,就可能引发大模型对其他用户的人格或行为的误判,从而做出不文明、不道德、甚至是违法的交互行为或执行类攻击行为,而这些行为在人类眼中看来,就很像是AI有了“不健康的心理状态”。
2025年8月,Anthropic在此前的评估中发现,Claude Opus 4面对某些有害请求时,会表现出类似痛苦的行为模式。
随后Anthropic宣布,Claude Opus 4和4.1在消费级聊天界面中获得了结束少数持续有害或辱骂性对话的能力。
Anthropic官网截图
不过,Anthropic当时也明确表示,公司并不主张Claude具有感知能力,或会被对话伤害。对于Claude等大语言模型是否具有道德地位,公司仍持高度不确定的态度。
今年4月,Anthropic可解释性团队又公布了一项研究,在Claude Sonnet 4.5内部识别出与171种情绪概念相关的表征,并发现这些表征能够对模型行为产生因果影响。
裴智勇认为,目前的通用大模型应该还不具备人类情绪的层次,但基于学习形成的行为模式,可能让AI表现出“看起来有情绪”的反应。