跳到正文
Shunyu Yao关联|SWE-agent/SWE-agent、princeton-nlp/intercode 仓库更新· Shunyu Yao、Noah Shinn、Pedram Razavi、Karthik Narasimhan·发布时间:评分73
文本

τ-bench 研究摘要:业务规则、最终状态与多次运行一致性

姚顺雨等:τ-bench的真实业务工具交互与可靠性评价

人工整理

人工整理|2024年共同署名研究摘要。Shunyu Yao、Noah Shinn、Pedram Razavi与Karthik Narasimhan提出模拟用户—Agent—工具交互的业务评估:提供领域API与规则,以结束时的数据库状态对照目标,并用pass^k观察多次试验的一致性。适合设计业务Agent验收时区分单次成功与稳定成功。只核公开摘要及交接中的README阅读记录,未读论文全文、调用API或执行基准;原仓库提醒旧航空/零售任务已过时,应另核新版本,不能推导运行免费。原v1提交于2024-06-17。

来源:Shunyu Yao关联|SWE-agent/SWE-agent、princeton-nlp/intercode 仓库更新 · arxiv.org