从零构建 AI 智能体(二):用 Responses API 与大模型交互
这篇教程用 OpenAI Responses API 演示 AI 智能体与模型交互的基础:管理会话历史,区分流式回答与工具事件,再由客户端执行工具并回传结果。配套 ZeroAgent 示例还覆盖请求取消和订单信息的结构化提取。运行需配置 API 密钥、模型及兼容 Responses API 的服务地址;各服务对存储、推理和工具调用的支持不同,须查文档并实测。
这篇教程用 OpenAI Responses API 演示 AI 智能体与模型交互的基础:管理会话历史,区分流式回答与工具事件,再由客户端执行工具并回传结果。配套 ZeroAgent 示例还覆盖请求取消和订单信息的结构化提取。运行需配置 API 密钥、模型及兼容 Responses API 的服务地址;各服务对存储、推理和工具调用的支持不同,须查文档并实测。
Alex Grigg 建议首次尝试动画的插画师,从已有插画入手,只让其中很小的一部分动起来。他认为,这样能沿用自己喜欢的画风,在尝试更大项目之前建立动画制作信心。配文提到,他经 @kawafi 许可,为她的画作制作了视频中的动画。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
Hoodzpah 为洛杉矶媒体 L.A. Material 制作品牌视觉,选用呼应霍克尼绘画的鲜蓝色、高速公路路牌绿和橙色。团队用渐变映射把品牌色应用到洛杉矶照片,也借此统一员工头像,并提供照片处理方案与模板,让客户内部团队自行制作品牌营销内容。由于客户通过 Beehiiv 发布邮件通讯和网站,字体选择限于 Google Fonts,最终采用 Instrument Sans 与 Bitter。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
摄影师阳辉以团队内训中的玻璃香水拍摄对比,拆解背景、瓶盖和瓶身图文的布光分工。背景灯用束光筒打出右侧渐变高光、照透香水液体,并透过窗格道具形成背景;顶灯靠前向下照,底灯在产品正下方向上照,共同打亮瓶盖。右侧稍靠前的聚光筒通过调整角度和叶片,照亮瓶身中心图文及瓶盖,保持硬光并避免干扰背景和其他区域。
仅基于配文整理;正式参考价值分;依据原始文字;已检查6幅静态图片评审副本;未评价完整视频、运动、剪辑或声音;未覆盖全部素材
作者从零构建 AI 智能体,采用前后端分离架构,以终端交互界面(TUI)作为首个前端,并在尝试 Go 和 Python Textual 后选择全栈 TypeScript。他称切换到 OpenTUI/Ink 生态后,界面卡死与渲染异常得到解决,并以统一技术栈为由选用 TypeScript 后端。工程上,他建议从项目初期建立日志与测试能力;较复杂、脆弱的界面端到端测试则用于低频按需校验,而非高频 CI 阻断。
阿三学姐称,这条电视广告(TVC)从创意到成片全部由 AI 工具完成,没有摄影师、灯光师或演员,也没有实景拍摄。她表示会拆解制作思路与工具流程,供想做 AI 影像的人参考;配文本身未展开具体工具和操作步骤。
仅基于配文整理
Jingna Zhang 提出 AI 艺术防骗指南,建议综合核查报价、创作者历史、社群信誉与图像线索,不依赖单一迹象判断真伪。她引用 Glaze 团队的 2024 年研究,指出普通人的识别准确率为 59%,误报率和漏报率均为 40%,研究链接为 http://arxiv.org/abs/2402.03214 。指南提醒,AI 可以生成逼真的创作过程视频、草图甚至直播内容,检测器也可能被绕过,而手脚画不好、线条断裂等人类创作错误不能单独作为使用 AI 的依据。
正式参考价值分;依据原始文字;未评价画面质量;未评价完整视频、运动、剪辑或声音;未覆盖全部素材
Entagma 的 Vellum 201 第 8 集教程以在 Houdini 中制作 Studio Drift 的 Shylight 为主题。配文列出的相关主题包括布料模拟、折叠、褶皱与约束,但没有展开具体制作步骤;内容标有 Premium Content,未说明访问条件。
暂评分;不自动精选;依据原始文字;未评价画面质量;未评价完整视频、运动、剪辑或声音
Tim Wallace 最近受托拍摄 Van's RV-10,通过影像呈现机主亲手建造飞机的工艺与个人投入。RV-10 是 Van's Aircraft 提供的套件飞机,供建造者自行组装。拍摄借助角度、光线、构图与环境,突出机身和驾驶舱等细节,记录飞机背后的人物故事。
来源冻结,保留历史评分;当前未重新评审
Better Harness可读取多种Coding Agent的本地记录,跨项目查看模型、工具、Skill和token活动。文章进一步提出,将这些活动关联到需求、代码变更和验收结果,才能判断方法是否有效、是否值得复用。当前看板已能观察执行活动,完整任务证据关联仍在探索,不能把调用次数当成交付成效。
AntV 认为,AI 选对图表类型还不够,默认样式与交互应让首次渲染的结果就能阅读、核对。GPT-Vis 1.0.1 已调整默认值:单系列用单色,密集标签自动旋转并隐藏多余标签,悬浮提示集中显示同一时刻的多系列数值;用户仍可覆盖配置。它已接入 Sive,由 Sive 查询和计算,GPT-Vis 只展示确定结果,不重新聚合数据或推断业务原因。
作者用 cordis-demo 拆解 Cordis 的插件生命周期:依赖服务尚未注册时,插件先等待;服务注册后重新检查依赖并启动。定时器、事件监听等操作会保存撤销函数,卸载时按注册的逆序清理。服务扩展则分两层:声明合并让 TypeScript 识别新增属性,运行时注册让属性真正指向服务实例。这是源码机制讲解与可运行演示,生产级 Cordis 还有额外的作用域和异步重载等机制。
Alex Grigg 推荐用 Boil 动画把已有插画转化为动画,尤其适合作为插画师的入门项目;他表示自己在专业工作中也经常使用这一手法。本项目使用了 @kawafi 和 @jonwrhan 提供的插画。想了解更深入的做法,可从他的个人简介进入完整 YouTube 课程。
仅基于配文整理;正式参考价值分;依据原始文字;未评价画面质量;未评价完整视频、运动、剪辑或声音;未覆盖全部素材
Trizz 在 BelVita 项目中通过摄影测量扫描真实饼干,将碎屑、破损边缘和不平整表面等细节带入数字素材。团队表示,实物细节保留了食物的真实感与诱人观感,计算机生成画面(CGI)则让他们能够控制运动、时序和构图,展示了实拍与 CG 配合的制作思路。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
Trizz 为客户 BelVita 做了饼干画面对比测试,回应客户对电脑生成(CG)饼干可能显得“过于完美”的担忧。团队将同一组镜头制作两遍:一版完全实拍,另一版采用拟议的实拍结合 CG 方案,让客户并排比较两种制作方式的成片质感。配文未说明客户最终选择或测试结论。
仅基于配文整理
摄影Aleo认为,室内与室外的极简布光遵循同一逻辑:以天空光为环境光、顶灯为主光,关键是控制两者的比例。让光线透过伞和屏形成柔光,使面部结构更立体、明暗过渡更柔和,并在正前方一侧设置基础填充光。
仅基于配文整理;正式参考价值分;依据原始文字;已检查2幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
illo在Araldica动态系统中重新设计经典媒体播放器视觉,以方形图案对应音乐、圆形图案对应播客。可参考用图形规则区分内容类型,再统一为动态界面;团队仍在制作演示,帖子不是已经公开可直接使用的播放器。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
颜布 Doria zhuo 为客户绘制了一组贝壳插画,并应用于卡片和杯子。考虑到单个贝壳图案容易与其他作品近似,作者采用了贝壳组合加文字的设计方式。卡片使用了作者一直想找机会尝试的蓝色特种纸,这次项目也让这款纸有了实际应用。
仅基于配文整理;正式参考价值分;依据原始文字;已检查2幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
设计师陈末为联思谱芯制作半导体品牌 LOGO,采用交织闭环几何结构与融合字母,优先考虑缩小后的辨识度,主视觉以深紫搭配少量橙色。作者强调,B 端科技品牌设计要兼顾丝印、金属蚀刻、展会物料、官网和 PPT,并适配单色及深浅底色,避免复杂图形在产品外壳、铭牌上失去清晰度。
正式参考价值分;依据原始文字;已检查6幅静态图片评审副本;未评价完整视频、运动、剪辑或声音;未覆盖全部素材
作者将 ROS 2 高频命令整理成两张速查表,供写代码和调试机器人时查用。一张覆盖工作空间构建、包管理、节点、计算图、话题查看与消息发布;另一张覆盖服务、参数、动作、rosbag2、启动、生命周期和系统诊断。作者推荐按 source 加载环境 → list 找对象 → info 看详情 → echo/call 验证数据的顺序排查。
dotey 称,他用两台电脑、两个 cc 账号,在今天重置后同时开始使用,一个开启 1m 上下文,一个禁用,观察到模型 token 消耗有明显差异。后来,消耗较快的账号关闭了 1m 上下文,消耗速度随即下降。帖中未提供具体用量或两边任务是否相同的信息。
dotey 分享个人使用经验,称禁用 Claude 的 1M 上下文能让模型 token 更耐用,使用 Fable 5.1 时尤其明显。具体做法是在 ~/.claude/settings.json 的 env 中,将 CLAUDE_CODE_DISABLE_1M_CONTEXT 设为字符串 "1"。
仅基于配文;附链正文尚未取得
消融实验用控制变量的方法,判断模型中的某个组成部分究竟贡献了多少效果。关键做法是系统性地移除或修改特征、模块或参数,观察性能如何变化,再据此定量评估该部分对整体效果的贡献。
Alex Grigg 的动画入门建议系列面向想尝试动画的插画师,第 1 期聚焦起步时如何选择动画应用。该系列由他与 @kawafi、@jonwrhan 合作制作;现有配文只提出选工具的问题,没有列出具体推荐或操作步骤。
仅基于配文整理;暂评分;不自动精选;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
AI 大量生成代码后,代码生成成本下降了,但团队理解系统的成本没有同步下降,这种缺口被称为“理解债务”。文章讨论如何用 Harness Engineering 把任务边界、测试、类型检查、Linter 和独立评估写进 Agent 工作环境,把人的注意力留给架构、业务语义和高风险变更。规格驱动开发能对齐需求,却不能替代对实现的理解;更现实的方向是按风险决定自动合并或人工审查,而不是完全跳过代码阅读。
Trizz 在围绕 The Miracle Broth™️ 制作的影片中,将液体生产过程转化为视觉语言。据其配文,受控条件、光照处理和声音振动都参与液体的转化;团队以波浪、能量与运动呼应这些真实工艺,把科学过程转译为更具感官体验和电影感的表达。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
Yeah师傅制作了一条以“华人之光”为主题的2分钟AIGC短片,围绕林连玉守护马来西亚华文教育展开叙事。配文以1956年学校面临的选择——放弃华文教学换取津贴,或坚持华文、自负盈亏——为起点,将个人抗争与独中、华人社群的持续投入相连接,突出华文教育的延续。配文未披露具体生成工具或制作流程。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅视频封面静帧评审副本;未评价完整视频、运动、剪辑或声音
phodal 已将 Lottie 插件 0.1.0 发布到 Qoder Marketplace,可在 Qoder 中创建、编辑、打包、校验和预览动画。设计重点是保留对象身份与工程版本,让智能体提交完整动画程序,再由运行时比较差异、试运行和验证,支持后续修改。当前已打通生成 .lottie、静态校验与 Canvas 播放;让用户在画面和时间轴上选择修改目标、再交给智能体处理,仍是下一步。
正式参考价值分;依据原始文字;已检查1幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
Refik Anadol Studio 回顾了 2023 年在巴塞罗那巴特罗之家立面呈现的机器智能艺术作品。工作室称,创作使用近 10 亿张高迪相关图像,包括草图、档案与巴塞罗那影像,并结合城市实时变化的风与光。作者将这次创作与洛杉矶 Dataland 联系起来,强调以数据、自然和机器智能构成持续变化的建筑体验。
仅基于配文整理
马克的技术工作坊分享以 AI 编程稳定交付高质量产品为主题的全流程,但现有正文只有标题和标签,未提供具体步骤、工具用法或交付验证方法。
Burning 在纵深不足、缺少完整背景的访谈场地,选择窗帘作背景,用大光圈虚化配合光影营造层次。主灯采用500瓦led搭配120cm柔光罩,人物斜后方用40瓦棒灯勾勒轮廓,背景则用200瓦led搭配聚光桶制造明暗变化。这是作者平时用于访谈与个人IP口播拍摄的器材搭配和布光思路。
仅基于配文整理
AI摸鱼手册分享了自己为客户制作短视频的流程:让AI写脚本、生成画面和配音,再辅助剪辑,最后人工检查优化后交付。先输入客户产品、沟通方式、视频时长与要求;缺少素材时,用文字描述生成画面并筛选,再将画面、配音、字幕和背景音乐放入剪辑软件处理。配文提供的是接单制作的流程概览,没有列出具体工具或逐步操作。
仅基于配文整理;正式参考价值分;依据原始文字;已检查2幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
illo 将一次内部探索扩展为完整的 Araldica 项目,定位为色彩丰富、基于声音的动效工具包。项目视频完全使用 Cavalry 制作,再以视频为起点用 TouchDesigner 生成音乐,并配套一个 illo 风格的音乐播放器;illo 说明,除视频中的音乐外,其余听到的音乐均由自研生成工具制作。
仅基于配文整理
Burning建议从空间、光线、噪音和背景四方面筛选访谈口播场地,减少环境对人物画面与收音的干扰。优先选开阔空间,让人物与背景间隔1.5米以上,便于背景虚化;现场应避免阳光直射人物,并提前排查施工、航线和人流噪音。背景要干净完整,尽量贴合受访者的行业与故事,避开抢眼色块、切到人物的线条和高反光材质;场地受限时仍需现场取舍。
仅基于配文整理;正式参考价值分;依据原始文字;已检查5幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
上海魔摄商业摄影分享为工业类客户拍摄的产品案例,以机械、机床的白底图为主,主要用于客户官网和宣传手册。由于这类设备运输不便,制作方通常到客户现场搭建白背景拍摄;遇到体积较大的机械,则使用大型白布作为背景。
仅基于配文整理
AI摸鱼手册自述,用 AI 辅助接单的第一天到账 200 元:3 单文案合计 120 元、1 单简历优化 60 元、为小店制作主图 20 元。作者据此认为,客户愿意为省时间付费,服务溢价来自人的审美、经验与服务,并建议新人先完成第一单。配文还列出绘图、短视频代做、翻译校对和模板销售等方向,但没有展开具体工具与交付步骤。
仅基于配文整理
Philipp 在 Entagma 的客座教程中,以蜂蜜 FLIP 流体模拟场景演示如何添加可变形气泡;教程说明称,这一做法无需重新模拟或复杂的额外设置。页面提供跟练用的基础文件和项目文件下载入口,并列出蜂蜜搅拌棒模型、HDRI、区域灯纹理与木材着色器等素材。
暂评分;不自动精选;依据原始文字;未评价画面质量;未评价完整视频、运动、剪辑或声音
AI摸鱼手册建议按“脚本→出图→动态→配音→剪辑”制作AI视频,先明确各环节分工,再增加工具。先用 ChatGPT 等工具梳理选题、脚本和分镜,再用 Midjourney 生成关键画面,交给 Runway 等工具做图生视频;配音单独制作,最后在剪映中整合。作者强调,成片效果还取决于剪辑节奏、画面与旁白的对应,以及声音和字幕的配合。
仅基于配文整理;正式参考价值分;依据原始文字;已检查1幅静态图片评审副本;未评价完整视频、运动、剪辑或声音
北京产品摄影-小羽分享电商白底图拍摄主题,称只需3步即可完成。配文只有这一主张和摄影相关话题,未列出具体步骤、器材或布光参数,无法据此还原可操作的拍摄流程。
仅基于配文整理
上海魔摄商业摄影分享了一个沙棘保健品拍摄案例,包含微观置景与创意拍摄场景两部分。微观场景约在拍摄前一天搭建,其中的围观小人提前定制,并非购买现成品。创意场景的道具也提前用定制喷漆处理,实际拍摄耗时两天。
仅基于配文整理;正式参考价值分;依据原始文字;已检查5幅静态图片评审副本;未评价完整视频、运动、剪辑或声音