跳到正文

首页

4 条
清除筛选按发布时间 · 最新在前
10月10日周六
  1. dotey / X 原生订阅发布时间:66
    模型与能力 · 文本

    微软发布 Microsoft-Decision-1:基于 Qwen3.5-9B 后训练,专做有限选项判断

    dotey 转述,微软发布的 Microsoft-Decision-1 基于 Qwen3.5-9B 后训练,专门从有限选项中作判断,输出程序可直接使用的结构化结果和概率分数。它支持是非题、多选题和评分,可用于反馈分类、模型路由及 AI 回答评价。模型已在 Microsoft Foundry 上线,每百万输入模型 token 0.042 美元,输出免费;OpenRouter 尚待上线。

10月7日周三
  1. Koto / instagram发布时间:
    案例 · 视频

    Koto 为 Copilot 与 M365 从熟悉的界面动作提取品牌语言

    Koto为Copilot与M365设计相互关联的视觉系统,以“事物汇聚的力量”为核心,把M365应用中熟悉的界面动作转成颜色、字体、标志和动态语言。它延展到活动、网站工具包和产品影片,可参考如何从产品交互本身提取品牌特征。

    仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音

10月5日周一
  1. GitHub Blog · AI & ML发布时间:56
    编程与智能体 · 文本

    GitHub 发布 ReviewBench 开放基准,评估 AI 代码审查智能体

    GitHub 发布 ReviewBench,用 219 个真实代码变更请求比较 AI 代码审查工具找错准不准、漏掉多少问题。样本来自 19 种语言、187 个开源仓库,分布参考了 103.9M 条 GitHub pull requests;两者不是同一个评测规模。它整合人工、模型和静态分析发现的问题,并按统一标准评分,支持提交自己的审查智能体,适合比较误报、漏报与严重问题识别能力。

10月4日周日
  1. Hugging Face Blog发布时间:49
    编程与智能体 · 文本

    ThinkingBox:AI 智能体说任务已完成,数据库却不认同

    微软与Hugging Face联合介绍ThinkingBox,依据AI智能体执行后的后台记录和副作用判断任务是否完成。基准涵盖507个有状态业务工作流,每项重复20次,区分单次成功、至少一次成功和20次全成功。可通过OpenEnv自行运行,结果仅适用于该基准及测试模型,不代表所有真实任务的可靠性。