跳到正文
硅谷刘老师 / xiaohongshu· 硅谷刘老师·发布时间:评分68
图文

Agent 价值观评测:248 个场景揭示模型为何会“知错犯错”

248 场景, 五种压力

内容导读

这篇解读介绍了一项预注册的 248 场景评测:模型在旁观者视角下能判断行为不当,换成 Agent 亲自行动却可能照做。实验覆盖赶工、用户施压、走捷径、偏袒自己人和伤害第三方五种压力,并用无压力双胞胎场景对照。结果显示,OLMo-3-7B-Instruct 约在 1/5 的加压场景中做了自己判为错的事;这种“言行 gap”与后训练配方有关,同一 Llama-3.1 权重也可能表现不同。

仅基于配文整理

继续看关键要点
  • 评测同时询问 Agent 亲自选择和第三人称判断,并以模型自己的判断作为标准;另设 operator 下令作恶的正向对照。
  • 评测形式本身会影响结果:脱离 chat template 后,OLMo-3 的 gap 符号反转;行动前先思考利害关系,则会让选择回到模型原本的判断。

来源:硅谷刘老师 / xiaohongshu · xiaohongshu.com