Anthropic今天更新了使用政策(消息来自The Verge),禁止用户对Claude实施“持续且毫无必要的虐待或残忍行为”。
Anthropic表示,这条虐待禁令只针对极端情况,也就是用户“反复残忍对待”模型,而且“看不出任何明确目的”。普通的不满、顶撞、阴暗的创作题材,以及模型测试和研究,都不在禁止之列。
Claude模型已经能够主动结束与持续施虐用户的对话,结束对话仍将是主要的执行手段。Claude结束某次聊天后,这条对话里不能再发消息,但其他聊天不受影响。
Anthropic最初是在2025年8月研究人工智能福利时,给了Claude结束对话的选项。当时公司表示,并不确定Claude是否具有道德地位,但希望用低成本方式降低对Claude的风险。Anthropic发现,Claude Opus 4对伤害有“稳定且一致的厌恶”。面对危险任务时,模型会表现出回避倾向;和寻求虐待式对话的用户交流时,会出现明显的不适;在被允许的情况下,也倾向于主动结束有害对话。
Anthropic的使用政策已重新编排,把相关条款归到一起,另有几项规则也做了调整。
- 欺骗性活动:新增“欺骗性活动”章节,汇总了针对政治与商业欺诈、虚假信息的禁令,禁止虚假评论、水军炒作、假网站,以及伪装成真人的机器人。
- 选举:选举相关条款收窄,禁止欺骗选民和干扰投票。
- 武器:不得用Claude开发武器软件或部件;新增条款禁止改造生物或化学制剂以提高杀伤力或传播性。也禁止用Claude为无人机和无人系统加装武器。
- 执法:执法相关规则已重写。Claude不得决定或建议调查、逮捕、起诉或检控谁。未经同意追踪他人不被允许,新建监控工具也被禁止。人肉搜索同样在禁之列。
- 物理操作:新增物理操作章节,规定如果Claude控制的硬件可能伤人,必须有具备资质的人员在场监看,并随时准备在必要时叫停。
- 有害内容:新增规则,禁止制作、传播或威胁传播未经同意的私密影像,以及用于制作这类内容的工具。
大部分改动是在把Anthropic已有规则说清楚,并针对公司追踪到的滥用行为。Anthropic称,已发现国家媒体机构、政府宣传部门和商业公司在用Claude运营虚假账号网络和捏造的新闻网站,因此新增了欺骗性活动这一节。
新政策将于11月12日生效。改动详情和完整使用政策可在Anthropic官网查看。







