跳到正文

首页

81 条
清除筛选按发布时间 · 最新在前
10月2日周五
  1. AI大模型应用实践 / wechat发布时间:74
    编程与智能体 · 图文

    上手体验 OpenAI DevDay 新功能:Dots、Decisions API 与开源 Codex Harness 更新

    作者体验了 OpenAI DevDay 的云端助手 Dots 与 Codex Harness 即时打断:前者在用户离开对话后仍能推进任务,后者可先回应追加要求,再取回后台工具结果。文中还介绍了从有限候选答案中选择结果、用于工单分流等任务的 Decisions API,以及整理、协作编辑成果的 ChatGPT Space。按文中说明,Dots 仅向 Pro 等部分账户开放,对话不占套餐用量;Decisions API 仍处于有限预览。

9月30日周三
  1. 懂点AI的Jack / douyin发布时间:17
    编程与智能体 · 图文

    金融 AI 智能体正在落地,真正稀缺的是懂业务的人

    懂点AI的Jack认为,金融 AI 智能体正在落地,真正稀缺的是理解金融业务的人。配文提出了这一人才需求判断,但没有展开具体案例或能力要求。

9月29日周二
  1. 李木木 / xiaohongshu发布时间:
    工作流 · 视频

    OiiOii 一镜到底工作流:作者称7个空间一条就过

    李木木用 OiiOii 的3D预演台,先检查人物路线与运镜衔接,再生成女主穿过剧院后台的连续镜头。作者先用几句话生成简化三维白模及人物、镜头运动路径,不满意的部分交给3D智能体修改;确认动作和节奏后,将预演、场景与人物素材一起送入视频节点。作者称最终成功生成视频,并主张先在预演阶段找出问题,减少成片后推倒重来的成本。

    仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音

9月28日周一
  1. 罗西的思考 / wechat发布时间:29
    编程与智能体 · 图文

    MemPO 源码学习笔记(5):用 GRPO 训练智能体记忆

    作者从源码解释 MemPO 如何训练长任务中的智能体记忆:除了最终答案奖励,还比较完整轨迹与记忆上下文对正确答案的预测能力,为每轮记忆增加质量信号。结果优势与记忆优势相加,后者仅作用于记忆片段,再通过统一的 PPO 更新训练模型。GRPO 用同题多条轨迹的组内统计替代价值评估网络,但记忆评分会额外增加一次前向计算。

9月27日周日
  1. AI大模型应用实践 / wechat发布时间:61
    编程与智能体 · 图文

    拆解 JEV(下):AI 智能体系统中的 8 类典型应用场景

    作者建议把 AI 智能体中高频、答案有限的判断交给 JEV:输入当前状态和判断标准,返回选择、评分或判断结果及概率,用于下一步动作、工具路由、风险检查等。8 类场景沿用同一分工:大语言模型负责规划与生成,JEV 做快速判断,程序负责执行与验证。作者提醒,当前决策模型不支持视觉理解,也可能误判;是否更快、更准,仍需上线前评估。

9月24日周四
  1. HelloSREAgent / wechat发布时间:39
    应用落地 · 图文

    SREAgent v3.0 发布:毕玄谈 AI 运维不止于提效

    贝联珠贯在云栖大会发布 SREAgent v3.0,面向企业运维,升级系统理解、根因诊断、对话和持续优化能力。厂商称,它可梳理系统依赖、串联多源故障证据,将诊断结果送入现有聊天和工单流程,再结合处置结果与人工反馈迭代。毕玄强调,AI 运维的价值应从个人提效延伸到组织协作与核心业务稳定性;原文提供 v3 云上版本体验入口。

9月23日周三
  1. 罗西的思考 / wechat发布时间:30
    模型与能力 · 图文

    MemPO 源码学习笔记(4):Rollout 多轮轨迹与记忆奖励的实现细节

    作者拆解 MemPO 的多轮对话轨迹生成与记忆奖励计算:先生成完整轨迹,再构造“系统提示+原始问题+当前摘要”的上下文,与完整历史对比预测正确答案的概率,用来衡量摘要保留了多少有效信息。计算只关注核心答案的模型 token,并分别过滤两种上下文中概率不超过 50% 的部分。作者指出,两路可能因此使用不同的答案片段,导致摘要的得分虚高;这些过滤只影响记忆奖励,不影响最终答案的对错判定。

  2. 腾讯云开发者 / wechat发布时间:60
    未分类 · 图文

    JEV:一个不会写代码的模型,为什么拿下4000万美元?

    作者认为,TypeSafe AI 的 JEV 将判断与生成分开:输入文本和预设问题,返回分类、分值与概率,可用于客服分流。关键价值是校准概率可作业务阈值,但不保证单次判断正确;替代转人工判断前,仍需与现有模型并行验证。JEV 是早期访问的闭源商业 API,输入 $0.042 / 百万 token、输出免费;官方称中文准确率目前偏低。

9月22日周二
  1. 罗西的思考 / wechat发布时间:50
    编程与智能体 · 图文

    机器人/物理 AI 智能体 Harness 综合分析与对比:从「更强的模型」到「更好的系统」

    作者比较五个机器人、手机与通用 AI 智能体项目,认为可靠性提升还要靠 Harness,即模型外围的控制与编排层。共通方法是分开决策与执行、把动作封装成可组合技能、将经验外置复用;例如 RPent 让大语言模型规划,冻结的视觉-语言-动作模型只负责接触操作。对比同时提醒:评估基准不等于可部署工具,优化收益需匹配预算验证,模拟器结果也不能直接代表真机表现。

9月21日周一
  1. AI圈的那些事 / xiaohongshu发布时间:35
    编程与智能体 · 图文

    Jev API 工具清单:20 项工具与应用

    作者整理了 20 项 Jev API 相关工具与应用,将其定位为帮助 AI 智能体做结构化判断、任务筛选和模型路由的决策能力。清单称,fast-jev-compaction 可过滤无效输出、压缩 Claude Code 上下文,jev-codex-router 则按编程难度选择模型与推理深度。内容属于功能概览,未给出部署步骤或调用费用。

    仅基于配文整理

  2. 大模型真简单 / douyin发布时间:8
    编程与智能体 · 图文

    从0到1手把手搭建一个 Agent

    这则内容以从0到1搭建一个 Agent 为主题,原文正文仅重复了标题和话题标签,未提供具体步骤、工具、运行环境、功能分工或使用条件。

  3. AI圈的那些事 / xiaohongshu发布时间:49
    编程与智能体 · 图文

    Jev API 怎么用?从 20 个项目看决策工作流

    作者汇总网友分享的 20 个 Jev 项目,核心分工是让 Jev 做分类、筛选、打分等简单决策,大模型负责执行任务。例如先判断任务难度再选择 Codex 模型,或先筛出高风险代码再交给大模型审查。作者认为,这种分工适合调用频繁、判断简单、无需生成长文本的环节,可按自己的工作流选择项目。

    仅基于配文整理

  4. HelloSREAgent / wechat发布时间:49
    应用落地 · 图文

    想要一台能跨应用办事的 AI 手机,你呢

    作者希望 AI 手机能听懂复杂需求、拆解任务并调动多个应用:例如比较淘宝闪购与美团的外卖价格和送达时间,让用户决定在哪家下单;或汇总各应用的积分及可兑换物品。作者认为,操作系统底层有机会支持这些能力,但仍需解决权限、数据开放、厂商利益协调和安全问题。这些是换机诉求,并非努比亚与豆包手机已具备的功能,作者也尚未实际体验该手机。

9月20日周日
  1. HelloSREAgent / wechat发布时间:66
    编程与智能体 · 图文

    SREAgent 团队反思:Harness 不再是垂类 AI 智能体的核心竞争力

    SREAgent 团队认为,管理上下文、工具调用和长任务运行的 Harness 支撑层,正被模型厂商承接,不再是垂类 AI 智能体的核心竞争力。作者称,新版 SREAgent 结合 DeepSeek Harness 后,自有评测表现变差;删除重复且冲突的部分后,效果恢复甚至更好,但未提供量化成绩。文章提出应重新审视这类工程投入,对新的核心竞争力是什么仍保留悬念。

9月15日周二
  1. 从码农到工匠 / wechat发布时间:56
    编程与智能体 · 图文

    从零构建 AI 智能体(二):用 Responses API 与大模型交互

    这篇教程用 OpenAI Responses API 演示 AI 智能体与模型交互的基础:管理会话历史,区分流式回答与工具事件,再由客户端执行工具并回传结果。配套 ZeroAgent 示例还覆盖请求取消和订单信息的结构化提取。运行需配置 API 密钥、模型及兼容 Responses API 的服务地址;各服务对存储、推理和工具调用的支持不同,须查文档并实测。

9月14日周一
  1. 从码农到工匠 / wechat发布时间:41
    编程与智能体 · 图文

    从零构建 AI 智能体(一):技术选型

    作者从零构建 AI 智能体,采用前后端分离架构,以终端交互界面(TUI)作为首个前端,并在尝试 Go 和 Python Textual 后选择全栈 TypeScript。他称切换到 OpenTUI/Ink 生态后,界面卡死与渲染异常得到解决,并以统一技术栈为由选用 TypeScript 后端。工程上,他建议从项目初期建立日志与测试能力;较复杂、脆弱的界面端到端测试则用于低频按需校验,而非高频 CI 阻断。

  2. 数据可视化 AntV / wechat发布时间:58
    编程与智能体 · 图文

    AntV 在外滩大会用 5 分钟介绍 Sive

    AntV 在外滩大会演示了 Sive,一个把数据上传、AI 分析和网页报告生成串在一起的可视化分析创作平台。用户提问后,系统执行查询和计算,生成可追溯数据来源的简报;选中结果后,可生成、预览和发布网页报告,获得分享链接。已有本地 AI 智能体或自动化流程的用户,可申请 API Key,通过 Open API 调用其数据分析与可视化能力。

9月11日周五
  1. phodal / wechat发布时间:
    编程与智能体 · 图文

    Qoder Mobile Use 在 AI IDE 中构建鸿蒙、安卓与 iOS 的智能体验证闭环

    Qoder 推出 Mobile Use 插件(Beta),支持安卓、鸿蒙与 iOS 从代码修改到设备交互、结果确认的验证闭环。开发者通过 Canvas 圈选问题区域,智能体通过 CLI 在同一设备会话中运行应用、执行交互并收集验证证据,结果不符时可返回代码修改后再次验证。插件已在 Qoder 桌面端与 Qoder IDE 中上新,通过各平台适配器接入现有开发环境,并以统一的技能与 CLI 提供观察、操作和验证流程。

9月9日周三
  1. 思特沃克洞见 / wechat发布时间:57
    编程与智能体 · 图文

    真实项目 Design-to-Code 实测:Kimi K3、Claude Opus 5 与 GPT-5.6 Sol 对比

    这是一场在真实企业前端项目中的 Design-to-Code 对比实测:作者用 GitHub Copilot CLI、自定义 Agent、Skill 和 Figma MCP,让三款模型把 Figma 设计稿还原为受 React 19、VDS、CSS Modules、i18n 与三道门禁约束的页面。测试中 Kimi K3 和 Claude Opus 5 均通过门禁,视觉分数分别为 74.8 和 60.4;GPT-5.6 Sol 因编译错误无法运行。作者认为,截图与节点树交叉验证、主动管理上下文和强制自检,比单看生成速度更影响可交付性。

9月8日周二
  1. phodal / wechat发布时间:64
    编程与智能体 · 图文

    Better Harness:把 Agent 调用记录连接到交付结果

    Better Harness可读取多种Coding Agent的本地记录,跨项目查看模型、工具、Skill和token活动。文章进一步提出,将这些活动关联到需求、代码变更和验收结果,才能判断方法是否有效、是否值得复用。当前看板已能观察执行活动,完整任务证据关联仍在探索,不能把调用次数当成交付成效。

9月4日周五
  1. 皮皮卜 / xiaohongshu发布时间:22
    编程与智能体 · 视频

    皮皮卜自研 AI 电商视觉平台:串联提示词、出图与精修

    皮皮卜称,自己用3个多月开发了一个面向电商视觉的 AI 智能体平台,将提示词编写、AI 出图和后期高清精修串成一站式流程。平台目前处于最后内测稳定阶段,配文未给出公开使用入口或开放时间。

    仅基于配文整理

9月3日周四
  1. 猫南北 / douyin发布时间:21
    编程与智能体 · 图文

    29岁Java女被裁后转Agent,三个月拿下30K

    这条抖音配文称,一名29岁Java开发者被裁后转向Agent,三个月后拿到30K。原文只给出转型方向和结果,没有说明具体学习路径、岗位类型、薪资单位或验证方式,读者无法据此判断可复用的转型方法。

9月1日周二
  1. 思特沃克洞见 / wechat发布时间:63
    编程与智能体 · 图文

    AI 代码生成如何用 Harness Engineering 管理理解债务与代码审查

    AI 大量生成代码后,代码生成成本下降了,但团队理解系统的成本没有同步下降,这种缺口被称为“理解债务”。文章讨论如何用 Harness Engineering 把任务边界、测试、类型检查、Linter 和独立评估写进 Agent 工作环境,把人的注意力留给架构、业务语义和高风险变更。规格驱动开发能对齐需求,却不能替代对实现的理解;更现实的方向是按风险决定自动合并或人工审查,而不是完全跳过代码阅读。

8月30日周日
  1. phodal / wechat发布时间:
    未分类 · 图文

    phodal 的 Lottie 插件:让 AI 智能体持续编辑动画

    phodal 已将 Lottie 插件 0.1.0 发布到 Qoder Marketplace,可在 Qoder 中创建、编辑、打包、校验和预览动画。设计重点是保留对象身份与工程版本,让智能体提交完整动画程序,再由运行时比较差异、试运行和验证,支持后续修改。当前已打通生成 .lottie、静态校验与 Canvas 播放;让用户在画面和时间轴上选择修改目标、再交给智能体处理,仍是下一步。

    正式参考价值分;依据原始文字;已检查1幅静态图片评审副本;未评价完整视频、运动、剪辑或声音

8月26日周三
8月24日周一
  1. 悟道智元丨AI实战营 / douyin发布时间:23
    编程与智能体 · 视频

    小公司应用 AI:用财务流程助手智能体梳理付款流程

    悟道智元丨AI实战营认为,小公司不一定要先增员,可以先用财务流程助手智能体整理付款范围、审批流程和角色分工,改变付款工作依赖一个人记、一个人管的做法。作者主张,企业应用 AI 的重点是推动制度和流程标准化,而非替代财务人员;配文未展开具体操作步骤。

8月18日周二
  1. 悟道智元丨AI实战营 / douyin发布时间:26
    编程与智能体 · 视频

    多智能体体育内容生产:先呈现推理过程,再决定发布

    作者主张,体育相关内容生产应先让 AI 呈现推理过程,而不是直接给出结论。其提出让多个专家 AI 智能体围绕数据源、赛程、赔率、历史比分和风险点交叉讨论,最后由主智能体做发布决策,并将这种分工视为企业级内容生产方式。

8月17日周一
  1. 神龙烈焰在吹雪 / douyin发布时间:34
    编程与智能体 · 图文

    TITO 是什么:Miles 如何保持多轮 AI 智能体训练轨迹一致

    这篇解读说明,TITO 要求上一轮的完整模型 token 序列原样成为下一轮提示词的开头,保证训练使用的上下文与实际推理一致。满足这一条件,多轮交互可拼成每个任务一个训练样本,减少训练计算量;上下文不一致则可能引发策略梯度异常和训练震荡。文中以 Miles 为例:为每条轨迹保留独立推理会话,只追加新消息和 token,并用增量分词避免改写历史序列。

8月14日周五
  1. Jina AI / wechat发布时间:25
    模型与能力 · 图文

    活动报名|腾讯云与 Elastic:2026 年做搜索就是在做 Test Time Compute

    腾讯云与 Elastic 将于 2026 年 8 月 21 日在深圳腾讯滨海大厦举办 AI 搜索技术大会,现已开放报名。肖涵将讨论 Test Time Compute:不再训练模型,而是增加检索、重排等推理阶段计算,搜索效果能否持续改善并迁移到新任务。腾讯云 Elasticsearch Service(ES)企业版计划同场发布,王峰将分享 jina-reranker-v3.5;可扫码或点击原文报名。

8月10日周一
  1. 神龙烈焰在吹雪 / douyin发布时间:41
    编程与智能体 · 图文

    大模型调用知多少:AI 智能体全链路拆解

    作者拆解了 AI 智能体调用大模型的完整链路:结构化消息经聊天模板变成提示词,再编码为模型 token ID;生成结果经解码与解析,返回助手消息或工具调用。文中用 vLLM 与 LangGraph 说明分工:前者处理底层推理与采样,后者保存消息状态、调度工具并维持多轮执行,帮助读者理解不同调用接口各自负责哪一段。

8月4日周二
  1. 优设 / wechat发布时间:62
    模型与能力 · 图文

    MiniMax、DeepSeek 等国产 AI 集中发力:优设解读大模型「反攻」

    优设认为,国产 AI 的「反攻」体现为竞争重心从算力与跑分转向单位成本、工作流和开放生态,并不代表已经全面胜出。7月31日也不是四家同时发布新基础模型:MiniMax H3上线、Seedance 2.5扩大开放、DeepSeek V4-Flash开启API公测,GLM Coding Plan则恢复订阅并调整价格与额度。作者提出按任务分配模型:强模型负责复杂规划,低价模型承担实现、测试等任务,再用评测与验证兜底。

7月16日周四
  1. Shunyu Yao关联|SWE-agent/SWE-agent、princeton-nlp/intercode 仓库更新发布时间:21
    应用落地 · 文本

    修复 SweBenchEvaluate 的 multimodal 子集映射,适配 sb-cli 的 swe-bench-m

    SweBenchEvaluate 将 multimodal 映射改为 swe-bench-m,解决 sb-cli 参数校验导致的评估失败。full 和 multilingual 无对应的 sb-cli 子集,现抛出列明支持子集的 ValueError,并新增相关回归测试。

6月23日周二
  1. 艾逗笔 / wechat发布时间:70
    编程与智能体 · 图文

    从 OpenClaw 到 FastClaw:如何设计优秀的多 AI 智能体架构

    FastClaw 作者结合 OpenClaw 托管经验,提出多人智能体平台应优先设计存算分离、用户隔离和故障回退。其做法是让网关无状态、数据库保存会话,按用户隔离记忆,插件在独立进程运行,外部服务失败时切换备用。作者称项目免费开源,可用作个人助理或产品后端运行时;本地用 SQLite,生产环境用 Postgres,文件可通过 S3 共享。

6月9日周二
  1. 艾逗笔 / wechat发布时间:49
    编程与智能体 · 图文

    ShipAny 新版发布:面向 AI 智能体编程的开发框架

    ShipAny 新版上线3套起步模板,核心做法是让编程智能体通过内置技能,在对话中调用登录、支付、存储等现成能力,开发 AI SaaS 网站。新版主推 TanStack + Vite 生态,并支持部署到 Cloudflare。老用户支付 $1.99 可获得新模板;新用户须通过文中邀请链接购买 Premium 会员,并输入优惠码 NEXT,才能立减 $50。

6月3日周三
  1. 艾逗笔 / wechat发布时间:52
    编程与智能体 · 图文

    聊聊 FastClaw 的 AI 智能体预装技能方案:最少内置,按需补充

    作者为 FastClaw 只预装 3 个技能:find-skills 在无法直接处理任务时搜索并安装技能;找不到合适技能时,由 skill-creator 创建并保存供后续复用;camoufox-cli 负责网页抓取、截图等浏览器操作。作者主张按任务动态补充技能,同时指出,这依赖模型智能与意图识别,成功存在不确定性;预装常用技能则可由管理员提前筛选和配置。

5月19日周二
  1. AI实战阿C / douyin发布时间:21
    编程与智能体 · 图文

    AI实战阿C的 AI 智能体搭建教程:从基础框架到项目实现

    AI实战阿C整理了一份面向复杂任务自动执行的 AI 智能体搭建教程,称覆盖基础框架搭建到真实项目实现。配文将核心环节概括为感知、记忆、规划与决策、行动及工具使用,并强调这项技能对 AI 产品经理求职的价值。正文仅给出教程范围,未展开具体搭建步骤、所用工具或运行条件。

5月17日周日
  1. AI实战阿C / douyin发布时间:10
    编程与智能体 · 图文

    AI Agent 搭建流程图:详细代码解析

    这条内容展示 AI Agent 的搭建流程图,并称配有详细代码解析。现有文字只给出主题和相关标签,没有展开具体步骤、代码、所需环境或可直接复用的实现细节;想了解完整流程,需要查看配图。

发布时间未知
  1. Andrej Karpathy关联|karpathy/autoresearch 仓库更新发布时间:未知未评分
    编程与智能体 · 文本

    Andrej Karpathy|autoresearch单GPU实验与保留/丢弃协议

    autoresearch的原生README与program.md描述单GPU实验协议:先建基线,固定prepare.py和评价,仅修改train.py;按训练预算运行,以val_bpb及显存记录结果,决定保留、丢弃或标记失败。五分钟指训练时间,另有启动、编译和评估开销,跨硬件结果不能直接比较。两个文档属于同一项目。本文仅整理已审文字,未运行代理、下载模型/代码包或调用模型API,未验证收益、硬件兼容与成本;源文的关闭权限和无限循环指令未执行。

  2. Shunyu Yao关联|SWE-agent/SWE-agent、princeton-nlp/intercode 仓库更新发布时间:未知未评分
    编程与智能体 · 文本

    姚顺雨等 / InterCode|交互环境、奖励与实验书面流程

    InterCode原生文档说明以执行反馈开展代码交互实验:建立容器环境并reset任务,step提交动作及观察输出,submit结束episode并计算奖励,记录trajectory,最后close资源。README列姚顺雨等共同作者,相关wiki署John Yang,不把团队代码或wiki归为个人独作。历史模型与旧接口按源文保留;本次未运行容器、任务、模型或代码,未验证成功率、当前兼容、费用与商业复用。