GitHub Blog · AI & ML· Michelle Zhou·发布时间:
文本GitHub 发布 ReviewBench 开放基准,评估 AI 代码审查智能体
ReviewBench: An open benchmark for AI code review
内容导读
GitHub 发布 ReviewBench,用 219 个真实代码变更请求比较 AI 代码审查工具找错准不准、漏掉多少问题。样本来自 19 种语言、187 个开源仓库,分布参考了 103.9M 条 GitHub pull requests;两者不是同一个评测规模。它整合人工、模型和静态分析发现的问题,并按统一标准评分,支持提交自己的审查智能体,适合比较误报、漏报与严重问题识别能力。
来源:GitHub Blog · AI & ML · github.blog