跳到正文

首页

15 条
清除筛选按发布时间 · 最新在前
10月10日周六
  1. dotey / X 原生订阅发布时间:66
    模型与能力 · 文本

    微软发布 Microsoft-Decision-1:基于 Qwen3.5-9B 后训练,专做有限选项判断

    dotey 转述,微软发布的 Microsoft-Decision-1 基于 Qwen3.5-9B 后训练,专门从有限选项中作判断,输出程序可直接使用的结构化结果和概率分数。它支持是非题、多选题和评分,可用于反馈分类、模型路由及 AI 回答评价。模型已在 Microsoft Foundry 上线,每百万输入模型 token 0.042 美元,输出免费;OpenRouter 尚待上线。

10月9日周五
  1. svpino / X 原生订阅发布时间:27
    编程与智能体 · 文本

    机器人系统用因果世界模型预测动作后果

    svpino 介绍的机器人系统,用因果世界模型预测不同动作可能怎样改变物理环境,并推理其后果。因果 AI 智能体负责保留任务上下文,为任务各阶段选择所需能力。统一工具接口则用于调用导航、学习得到的动作模型、基于规则的函数,以及检查执行结果。

10月8日周四
  1. op7418 / X 原生订阅发布时间:13
    未分类 · 文本

    Grok Bot 是否已用上 Opus 5.5?作者称复杂任务效果很好

    歸藏称 Grok Bot 处理复杂任务的效果很好,并猜测其底层模型是否已是 Opus 5.5。帖文未提供具体任务案例、评测结果或模型身份的确认信息,因此不能据此判断 Grok Bot 实际使用了什么模型。

  2. AI圈的那些事 / xiaohongshu发布时间:84
    应用落地 · 图文

    GPT-6 正式进入 ChatGPT 日常聊天

    这篇转述称,GPT-6 进入 ChatGPT 日常聊天后,可把回答做成可操作的智能界面,例如随人数调整食材用量和烹饪时间的购物清单。Plus、Pro、Business、Enterprise 今天起陆续可用,免费版与 Go 明天起分批开放;企业账号还取决于管理员设置。付费用户使用 GPT-6 Sol,免费版及 Go 使用 GPT-6 Luna。

    仅基于配文整理

    同一新闻,精选展示《OpenAI 全球推出带 Intelligent UI 的 GPT-6,分层使用 GPT-6 Sol 与 GPT-6 Luna》

  3. svpino / X 原生订阅发布时间:27
    未分类 · 文本

    从文档已有数值推导新数值的模型

    Santiago 分享了一种模型,能根据文档已有数值,计算文档中未直接写出的数值。例如,询问产品的年度使用成本时,它会从月度成本自动计算。作者根据演示视频判断,它似乎还能推断复杂公式;帖子未提供模型名称、使用入口或验证结果。

  4. 硅谷刘老师 / xiaohongshu发布时间:54
    模型与能力 · 图文

    UNREAL 论文解读:RAG 与长上下文如何统一证据选择

    硅谷刘老师解读的 UNREAL 研究,尝试用大语言模型自身的内部表示,统一 RAG(检索增强生成)和长上下文中的证据选择。方法冻结主模型,只训练不到 50 万个参数,用于编码文本片段并派生检索查询。配文称,该方法在 Wikipedia 检索和长上下文评测中均有提升,为长文档问答、知识库检索提供了研究思路。

    仅基于配文整理

  5. 硅谷刘老师 / xiaohongshu发布时间:67
    模型与能力 · 图文

    有损推测解码:部分回答加速方案可能增加安全风险

    这篇解读讨论有损推测解码:由小模型先写草稿,大模型再验证,以加快回答生成。文中称,部分方案只让任务准确率下降少量,却可能明显增加越狱与提示词注入攻击的成功率。研究提出 SecureSD,加强对开头生成内容的检查,在所测基准上改善安全表现,同时保持与现有方法相近的效率和效果。做推理优化时,可以把这类安全测试一并纳入验收。

    仅基于配文整理

10月7日周三
  1. Tibo发布时间:21
    模型与能力 · 文本

    Tibo 分享 AI 数学成果的博客入口

    Tibo表示团队模型解决了一些重要数学问题,并链接记录成果的博客,同时说明它们与当日其他发布无关。它适合用于继续核对具体问题与证明材料,短帖没有独立展示证明,也不意味着相关模型已可公开使用。

10月3日周六
  1. OpenAI News发布时间:
    模型与能力 · 文本

    GPT-6 系列模型实践指南:选型、成本控制与生产评估

    OpenAI 于10月2日发布 GPT-6 系列实践指南,建议按任务选择模型与推理级别。指南建议通过缓存和上下文压缩控制成本,并用任务成功率与延迟评估生产表现。

9月28日周一
  1. Sebastian Raschka|本人博客 RSS发布时间:48
    模型与能力 · 文本

    聚焦后训练:以 Ember-1 为例

    Fireworks 基于 Kimi K3 后训练得到 Ember-1,使其 token 用量减少约 40%,同时在评测中保持相近质量。训练重点是让模型生成更短的推理过程,具体算法尚未充分披露。Sebastian Raschka 建议在预算有限时基于现有开放权重模型,将资金投入后训练。

9月23日周三
  1. 腾讯云开发者 / wechat发布时间:60
    未分类 · 图文

    JEV:一个不会写代码的模型,为什么拿下4000万美元?

    作者认为,TypeSafe AI 的 JEV 将判断与生成分开:输入文本和预设问题,返回分类、分值与概率,可用于客服分流。关键价值是校准概率可作业务阈值,但不保证单次判断正确;替代转人工判断前,仍需与现有模型并行验证。JEV 是早期访问的闭源商业 API,输入 $0.042 / 百万 token、输出免费;官方称中文准确率目前偏低。

9月16日周三
  1. Chip Huyen / twitter发布时间:26
    模型与能力 · 视频

    限制模型只选预设值:适合标签和固定动作任务

    Chip Huyen介绍一种限制模型输出的思路:不给自由文本,而是从预先列出的值中选择,可用于数据标注或动作集合固定的任务。她称其输出token免费,但也指出推理如何进行尚不清楚;这是对一种方法的初步讨论,不是已验证的完整评测。

    仅基于配文整理

8月14日周五
  1. Jina AI / wechat发布时间:25
    模型与能力 · 图文

    活动报名|腾讯云与 Elastic:2026 年做搜索就是在做 Test Time Compute

    腾讯云与 Elastic 将于 2026 年 8 月 21 日在深圳腾讯滨海大厦举办 AI 搜索技术大会,现已开放报名。肖涵将讨论 Test Time Compute:不再训练模型,而是增加检索、重排等推理阶段计算,搜索效果能否持续改善并迁移到新任务。腾讯云 Elasticsearch Service(ES)企业版计划同场发布,王峰将分享 jina-reranker-v3.5;可扫码或点击原文报名。

8月10日周一
  1. 神龙烈焰在吹雪 / douyin发布时间:41
    编程与智能体 · 图文

    大模型调用知多少:AI 智能体全链路拆解

    作者拆解了 AI 智能体调用大模型的完整链路:结构化消息经聊天模板变成提示词,再编码为模型 token ID;生成结果经解码与解析,返回助手消息或工具调用。文中用 vLLM 与 LangGraph 说明分工:前者处理底层推理与采样,后者保存消息状态、调度工具并维持多轮执行,帮助读者理解不同调用接口各自负责哪一段。

7月29日周三
  1. Jina AI / wechat发布时间:50
    模型与能力 · 图文

    Jina Reranker v3.5:专注垂直领域的 0.6B 列表式重排器

    Jina AI 发布 Jina Reranker v3.5,以 0.6B 参数一次处理整批候选文档并重新排序,重点补强法律、金融等领域检索及 JSON、表格的条件判断。它结合局部与全局注意力,降低长列表计算开销,并通过扰动训练数据中的价格、规格等字段,学习“150 元以下”这类约束。API 已上线,权重可用 transformers 加载;权重采用 CC BY-NC 4.0 许可,商业用途需联系 Jina AI。