Anthropic 启动 500 万美元资助计划,支持独立研究机构开发开源评估工具,衡量 AI 对用户福祉的影响,并发布评估指南。申请截止 9 月 21 日。
Anthropic 宣布推出一个 500 万美元的资助项目,用于资助独立研究,探究 AI 如何影响用户的福祉。该项目将为获资助者提供直接资金、模型访问权限和技术支持,帮助他们构建开源评估工具,供整个 AI 行业衡量模型对使用者的影响。获资助者将完全独立工作,并以开源项目形式发布成果,任何开发者都可以使用。
AI 系统已成为许多人工作、学习和解决问题的重要工具,也正在成为对话伙伴,甚至能在艰难时刻提供情感支持。然而,作为一个行业,我们尚未建立明确的标准来规范模型在这些对话中的行为,比如当用户开始向模型寻求陪伴,或者使用 AI 应对心理健康危机时,模型应当如何回应。
福祉评估是一个特别困难的领域。对于大多数模型行为,我们可以通过单个回答判断其是否准确、恰当。但评估对用户福祉的影响需要更多上下文。例如,一个处于痛苦中的用户可能不会立即透露自伤念头;只有在长时间的对话中,模型需要采取更谨慎回应的需求才会显现。同一个回答在不同情境下可能合理,也可能有害。比如,Claude 可以给询问减肥的用户提供均衡饮食和锻炼计划的建议,但如果该用户有进食障碍史,这样的回答就可能不合适,甚至可能造成实际伤害。
Anthropic 一直在努力开发安全防护措施,识别这类对话,确保 Claude 恰当回应,并发布关于用户与 Claude 对话类型的研究,以指导安全防护措施的开发和评估。但这些考量非常微妙,风险也很高。正确的方法需要随着模型及其用途的演进而不断完善。
通过资助独立的福祉评估和基准开发,Anthropic 希望吸引更多专业人士投身这个新兴且至关重要的领域,包括临床医生、心理学家、方法学家等。
作为该项目的一部分,Anthropic 还发布了来自安全防护团队的指南,说明什么样的福祉评估才算严谨,以及常见的问题有哪些。简单来说,所寻求的评估应当:
想了解更多信息或申请,可查看申请表格。关于如何构建有效的福祉评估和基准,可以阅读完整指南。申请截止日期为 9 月 21 日;入选并提交完整方案的申请者将于 10 月 5 日前收到通知。
免费获取企业 AI 成熟度诊断报告,发现转型机会
关注公众号

扫码关注,获取最新 AI 资讯
3 步完成企业诊断,获取专属转型建议
已有 200+ 企业完成诊断