ThinkingBox:AI 智能体说任务已完成,数据库却不认同
微软与Hugging Face联合介绍ThinkingBox,依据AI智能体执行后的后台记录和副作用判断任务是否完成。基准涵盖507个有状态业务工作流,每项重复20次,区分单次成功、至少一次成功和20次全成功。可通过OpenEnv自行运行,结果仅适用于该基准及测试模型,不代表所有真实任务的可靠性。
微软与Hugging Face联合介绍ThinkingBox,依据AI智能体执行后的后台记录和副作用判断任务是否完成。基准涵盖507个有状态业务工作流,每项重复20次,区分单次成功、至少一次成功和20次全成功。可通过OpenEnv自行运行,结果仅适用于该基准及测试模型,不代表所有真实任务的可靠性。
Hugging Face 的 Diffusers 在开发文档中新增约束:只实现已发布模型权重需要的配置选项、代码分支和类,每个配置参数都须出现在真实发布的配置中。未来模型需要的选项应随该模型的 PR 一起加入;运行时参数也只应添加官方流程、示例或操作方案实际传入的参数。文档还要求删除无法执行到的代码路径,让代码更容易审查。
diffusers 的这次补丁修复 Cosmos3 FP8 在张量并行时的属性报错;张量并行是将模型张量拆分到多个设备处理。改动让分区逻辑仅处理线性层,跳过 ModelOpt 量化器子模块,避免因 TensorQuantizer 缺少 weight 属性而报错。
Hugging Face 的这次 Krea 2 代码提交,为提示词的文本特征及对应掩码添加标记,明确这些中间输出属于去噪器的输入字段。负向提示词的特征和掩码也添加相同标记,但这两项输出仅在启用 guidance(引导)时提供;改动集中在输出字段的元数据。
正式参考价值分;依据原始文字;未评价画面质量;未评价完整视频、运动、剪辑或声音
Jina AI 发布 jina-ocr-v1,将扫描页、照片或 PDF 转成 Markdown,保留表格和公式。它通过先预测、再验证后续文本加速;厂商单卡 L4 测试中,Eager 与 CUDA Graph 模式的最佳加速比分别为 1.95x 和 1.17x,收益随运行方式变化。可通过 API 调用或本地部署;本地推测加速需 vLLM 0.21 以上,权重采用 CC BY-NC 4.0,限非商业使用。