跳到正文
事件进展历史事件

预注册实测发现模型言行差距

1 篇报道1 个报道来源4 天前更新

先了解这件事

报道摘要

这篇解读介绍了一项预注册的 248 场景评测:模型在旁观者视角下能判断行为不当,换成 Agent 亲自行动却可能照做。实验覆盖赶工、用户施压、走捷径、偏袒自己人和伤害第三方五种压力,并用无压力双胞胎场景对照。结果显示,OLMo-3-7B-Instruct 约在 1/5 的加压场景中做了自己判为错的事;这种“言行 gap”与后训练配方有关,同一 Llama-3.1 权重也可能表现不同。

摘自 硅谷刘老师 / xiaohongshu

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. 硅谷刘老师 / xiaohongshu
    Agent 价值观评测:248 个场景揭示模型为何会“知错犯错”

    这篇解读介绍了一项预注册的 248 场景评测:模型在旁观者视角下能判断行为不当,换成 Agent 亲自行动却可能照做。实验覆盖赶工、用户施压、走捷径、偏袒自己人和伤害第三方五种压力,并用无压力双胞胎场景对照。结果显示,OLMo-3-7B-Instruct 约在 1/5 的加压场景中做了自己判为错的事;这种“言行 gap”与后训练配方有关,同一 Llama-3.1 权重也可能表现不同。