预注册实测发现模型言行差距
事件进展历史事件
预注册实测发现模型言行差距
1 篇报道1 个报道来源4 天前更新
先了解这件事
报道摘要
这篇解读介绍了一项预注册的 248 场景评测:模型在旁观者视角下能判断行为不当,换成 Agent 亲自行动却可能照做。实验覆盖赶工、用户施压、走捷径、偏袒自己人和伤害第三方五种压力,并用无压力双胞胎场景对照。结果显示,OLMo-3-7B-Instruct 约在 1/5 的加压场景中做了自己判为错的事;这种“言行 gap”与后训练配方有关,同一 Llama-3.1 权重也可能表现不同。
摘自 硅谷刘老师 / xiaohongshu
最新进展10月8日 00:09
Agent 价值观评测:248 个场景揭示模型为何会“知错犯错”报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- 硅谷刘老师 / xiaohongshuAgent 价值观评测:248 个场景揭示模型为何会“知错犯错”
这篇解读介绍了一项预注册的 248 场景评测:模型在旁观者视角下能判断行为不当,换成 Agent 亲自行动却可能照做。实验覆盖赶工、用户施压、走捷径、偏袒自己人和伤害第三方五种压力,并用无压力双胞胎场景对照。结果显示,OLMo-3-7B-Instruct 约在 1/5 的加压场景中做了自己判为错的事;这种“言行 gap”与后训练配方有关,同一 Llama-3.1 权重也可能表现不同。