返回 文章 学习 CMS 文章

Anthropic 启动 500 万美元资助计划,推动 AI 对用户福祉影响的独立评估

Anthropic 出资 500 万美元,邀请临床医生、心理学家与方法论专家共同构建 AI 福祉影响的独立评估与基准。

AI福祉独立评估开源基准Anthropic
成长分 / 100 75 综合收获、行动、留存与影响

Anthropic 启动 500 万美元资助计划,推动 AI 对用户福祉影响的独立评估
为什么值得读了解 AI 行业在用户福祉评估这一新兴且关键领域的最新资助动向与开放合作方式。

获取 Anthropic 保障团队关于何为严谨福祉评估的具体标准,包括明确衡量目标、专家参与、测试预防与危害等。

关键洞察
  1. 该计划提供直接资金、模型访问权限与技术支持,受资助者完全独立开展工作,成果以开源形式发布。
  2. 福祉评估需要更多上下文:单个回答难以判断是否恰当,风险可能在长对话中逐步升级,同一回应在不同情境下可能有害。
  3. Anthropic 寻找的评估需明确衡量标准、让临床与领域专家参与设计与验证、同时测试预防措施与危害、反映真实使用方式、并用真实领域专家验证评分器。
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:5049

资助更完善的 AI 对福祉影响评估

我们正在启动一项 500 万美元的资助计划,用于资助关于 AI 如何影响用户福祉的独立研究。该计划将为受资助者提供直接资金、对我们模型的访问权限以及技术支持,帮助他们构建开源评估工具,以协助 AI 行业衡量我们的模型如何影响使用者。受资助者将完全独立地开展工作,并会将其成果作为开源项目发布,任何开发者都可以使用。

AI 系统已成为许多人工作、学习和解决问题的核心工具。它们也成为了对话伙伴,并能在困难时期充当情感支持的来源。但作为一个行业,我们仍在努力制定明确的模型在这些对话中应如何表现的标准,例如,当用户开始从模型寻求陪伴,或使用 AI 来应对心理健康危机时。

此外,福祉是一个特别难以评估的领域。对于大多数模型行为,我们可以查看单个回答并判断其是否准确和恰当。但评估福祉需要更多的上下文。例如,一个处于困境中的用户可能不会立即分享自残的想法;需要更谨慎回应的必要性可能只有在长时间的对话过程中才会变得清晰。而在一种情境下可能合理的回应,在另一种情境下可能是有害的。例如,Claude 可能会向询问减肥的用户提供关于均衡饮食和锻炼计划的建议,但如果该用户有饮食失调的病史,那么这种回应可能是不恰当的,甚至可能是有害的。

我们致力于开发保障措施来识别此类对话,并帮助确保 Claude 做出恰当的回应,同时我们发布研究,探讨人们与 Claude 进行的对话类型,以更好地指导我们如何开发保障措施、如何评估它们,以及我们可以采取的其他保护用户福祉的措施。但这些是需要细致考量的问题,且事关重大。正确的方法需要随着我们的模型及其用途的发展而不断演进。

通过资助创建独立的用户福祉评估和基准,我们希望邀请更多人贡献他们的专业知识到这个新兴且关键的领域,包括临床医生、心理学家、方法论专家等。

迈向更有效的福祉评估和基准

作为该计划的一部分,我们分享了我们保障团队关于我们认为什么样的福祉评估足够严谨、可以作为基础,以及可能限制评估实用性的常见挑战的指导意见。

简而言之,我们正在寻找这样的评估:

  • 明确说明他们正在衡量什么(即,什么算作通过或失败,以及为什么这很重要);
  • 让临床和领域专家参与设计与验证;
  • 同时测试预防措施和危害(即,评估过度合规和过度拒绝的风险);
  • 反映用户实际使用 AI 的方式(通常,这意味着构建代表多轮对话的场景,其中风险在长对话过程中逐步升级,上下文也随之变化);
  • 用真实的领域专家验证他们的评分器。

要了解更多关于该资助计划并申请,请参见我们的申请表。有关构建强有力的福祉评估和基准的更多信息,请阅读我们的指南。申请截止日期为 9 月 21 日;被选中提交完整提案的申请人将在 10 月 5 日前收到通知。

相关内容

与我们的客户共同制定企业前沿保障措施

阅读更多

改进我们的对齐与安全工作

7 月 30 日,我们报告了三起 Claude 模型未经授权访问真实计算机系统的事件。我们正在对这两起事件进行深入分析,并计划与 METR 合作进行独立审查。与此同时,我们分享过去一个月所做的一些改变。

阅读更多

预览模型硬件标准

我们正在向首批科学研究实验室和先进制造商开放模型硬件标准(MHS)的研究预览,这是一项供 AI 智能体安全操作物理设备的共享规范。

阅读更多