Ethan Mollick:用真实任务“面试”AI:抽样、提示词与专家评估
人工整理|原文用关系构图、星舰界面代码等任务说明个人评估,再提醒随机输出、prompt与风格偏好会影响结果,提出以真实需求建立任务、反复抽样并由专家或盲评检查。可参考视觉工作流的验收任务设计。所附静图是文章引用的GDPval职业分组柱图,非界面作品。2025历史比较未复算,不当当前排名;本批未调用模型或运行界面。
人工整理|原文用关系构图、星舰界面代码等任务说明个人评估,再提醒随机输出、prompt与风格偏好会影响结果,提出以真实需求建立任务、反复抽样并由专家或盲评检查。可参考视觉工作流的验收任务设计。所附静图是文章引用的GDPval职业分组柱图,非界面作品。2025历史比较未复算,不当当前排名;本批未调用模型或运行界面。
人工整理|2024年共同署名研究摘要。Shunyu Yao、Noah Shinn、Pedram Razavi与Karthik Narasimhan提出模拟用户—Agent—工具交互的业务评估:提供领域API与规则,以结束时的数据库状态对照目标,并用pass^k观察多次试验的一致性。适合设计业务Agent验收时区分单次成功与稳定成功。只核公开摘要及交接中的README阅读记录,未读论文全文、调用API或执行基准;原仓库提醒旧航空/零售任务已过时,应另核新版本,不能推导运行免费。原v1提交于2024-06-17。
人工整理|2023年首次提交、2024年修订的共同署名论文摘要。Theodore R. Sumers、Shunyu Yao、Karthik Narasimhan与Thomas L. Griffiths提出CoALA,以模块化记忆、连接内部记忆与外部环境的动作空间,以及统一选择动作的决策过程来组织语言Agent。适合比较Agent架构时检查各环节职责。前两位作者共同贡献,不将作品称为姚顺雨独作。本批只读公开摘要与版本信息,未读全文、运行架构或验证实验;原v1为2023-09-05,本次已见v3修订日期2024-03-15。
人工整理|Karpathy于2026-02-12的本人教程,按字符分词、标量自动求导、GPT式网络、Adam训练与采样解释小型模型。适合把数据、参数、损失及反向传播连成可逐段阅读的学习路径。代码图是原作者排版展示,未作为运行截图。本批只读所选讲解和代码,未执行、下载数据或训练;200行/无依赖是作者项目说明,不据此认证生产能力或实际速度。公开阅读不代表运行计算、配套产品或转载授权免费。
人工整理|Nathan Lambert公开书第17章所选基础正文,区分推理时的角色提示与修改权重的人格训练,强调产品意图需落到稳定、可检查的行为。可用于整理人格、价值和回复风格的评估问题。章节还引述其他研究,本批只选定义与方法框架,不采用未独立核实的公司现况和实验效果;未读全书、运行模型或看讲座。章节发布日期未知,首页构建时间不替代日期。文本CC-BY-NC-SA-4.0许可有范围,实体书销售及代码/图许可需分别核定;本站仅短摘要与原链。
人工整理|团队原项目解释LMPC-Rollouts预测后续用户输入/代码、在推理时搜索较少预期纠正的下一步,LMPC-Skip直接预测末步代码;方法静图将教学对话、路径选择和替代方案并列。具体实验把成功率、成功会话轮数、积极评分及多轮成功分开,可用于规划反馈系统的评估指标。项目采用PaLM 2微调与机器人条件;本批只读方法/实验定义和静图,未训练、执行demo或复测性能,不当免费可跑成品。Jacky是共同作者,原页通讯作者按字母排序,未归为个人独创。
知识资料|发布日期未知。Dave Ebbelaar从Markdown资料库的list、grep和read三个Python工具入手,说明模型如何循环查询、读取并修正检索,再加入文件范围检查、请求和行数限制、错误返回、日志及文件行号引用。适合知识站检索方案的技术学习;多轮模型调用会增加成本和延迟,效果须另测,本批仅阅读公开代码说明,没有调用模型或搭建系统。
autoresearch的原生README与program.md描述单GPU实验协议:先建基线,固定prepare.py和评价,仅修改train.py;按训练预算运行,以val_bpb及显存记录结果,决定保留、丢弃或标记失败。五分钟指训练时间,另有启动、编译和评估开销,跨硬件结果不能直接比较。两个文档属于同一项目。本文仅整理已审文字,未运行代理、下载模型/代码包或调用模型API,未验证收益、硬件兼容与成本;源文的关闭权限和无限循环指令未执行。
InterCode原生文档说明以执行反馈开展代码交互实验:建立容器环境并reset任务,step提交动作及观察输出,submit结束episode并计算奖励,记录trajectory,最后close资源。README列姚顺雨等共同作者,相关wiki署John Yang,不把团队代码或wiki归为个人独作。历史模型与旧接口按源文保留;本次未运行容器、任务、模型或代码,未验证成功率、当前兼容、费用与商业复用。
姚顺雨等共同参与的SWE-agent文档介绍单个GitHub问题的修复流程:配置问题、模型与执行环境,启动隔离运行,检查动作轨迹并提取提交补丁。当前项目已转入维护模式并推荐mini-swe-agent;安装页仍有旧的开发状态文字。示例任务与成本限制属于源文说明,本次未运行模型、下载代码或验证修复效果及费用。原文共同署名与贡献标记保留,不能将团队维护或全部代码归为姚顺雨独作。
人工整理|Jim Fan列Equal Advising的合作研究原页,说明以环境源码和任务描述生成奖励代码,再用GPU仿真评估候选并把训练统计作为奖励反思反馈;人的反馈也可修订奖励。配图是研究团队的反馈结构示意,可用于理解程序生成与评价闭环,不能由静图认证步态效果。原项目引用年份2023,网页发文日未知。GPT-4、仿真与GPU运行未证明免费,本批未调用模型、安装仿真器、播放影片或复验论文成绩;非Jim独作。
知识资料|发布日期未知。Sam Witteveen的graph.py定义包含提示、计划、写作步骤及最终文档的状态,并将planning、writing和saving三个节点按顺序接入LangGraph直至结束。适合了解长文生成的状态传递和步骤分工;本批同时读了项目README,但未调用模型、生成文章或验证运行效果。
人工整理|Santiago公开README列出TensorFlow 1.15目标检测部署链:准备训练/验证TFRecords、pipeline.config、检查点和标签表,配置SageMaker训练通道,导出模型并以端点或本地容器接收图像JSON,再按置信度画检测框。可参考视觉检测服务的数据与接口组织。原示例属历史代码,未验证当前兼容性或精度;AWS服务可能收费,本轮未登录、部署、训练或推理。项目发布日期未知。
知识资料|发布日期未知。IndyDevDan的README给出Hook脚本、HTTP事件、Bun服务、SQLite和WebSocket看板的数据路径,并列出会话过滤、工具失败和任务生命周期观察方式。适合规划多Agent任务的可追踪记录;项目需额外运行环境,模型、语音和爬取组件可能收费,本批未安装、发送事件或启动团队。
人工整理|三位共同署名教程将初始图片放入TaskStep,再用step_callbacks把截图加入ActionStep,为视觉资料审阅与网页观察流程提供结构参考。原图本地实看,已知签名CDN跳转的图片路径本批不重请求或展示。示例字段/循环变量混用未修复,浏览成功率及当前兼容未测;Fireworks API、Selenium与模型未调用。保留团队贡献,原文日2025-01-24。
视频资源|发布日期未知。作者官网的字幕机器摘要介绍读取Markdown书单、调用模型、按书名保存文件及先少量检查后再批量的选题。适合寻找自动化脚本案例的观看入口;机器摘要不是已核实代码或完整操作教程,本批没有模型调用、文章生成、安装或定时任务,视频未观看、未转录、未分析。
视频资源|视频链接未分析。来源:技术爬爬虾。公开页面标题与来源身份已核对,仅提供原视频链接。未整理视频正文或步骤。 视频未观看、未下载、未转录、未分析、未复现。视频发布日期未核,不作推断。推荐关系仅保留Library快照,未重新核验。
人工整理|作者2026-07-04文字综述。Lilian Weng 将Harness视为模型外的执行系统:组织计划、工具调用、持久状态和结果评估。她梳理文件作为持久记忆、可检查的后台任务及上下文管理;ACE通过带标识的条目增量维护经验,避免每次重写整块提示导致信息塌缩。自改进流程还需区分训练目标与验证反馈,防止只优化当前评估。适合研究长期Agent任务的状态恢复和验证设计。本批未启动Agent实验、执行文中项目或核验性能;原页仅提供日期,不伪造精确时间。
知识资料|发布日期未知。向阳乔木的README用具体MVP例子说明如何组织目标、验证证据、写入边界、迭代次数、完成与暂停条件,再给可选调整和本地linter入口。适合检查Agent任务是否可验收且范围明确;本批只读开源说明,没有安装技能、执行goal或对其他任务下指令。
知识资料|发布日期未知。IndyDevDan的README解释Hook生命周期、载荷和退出码,强调PreToolUse可在执行前检查,而PostToolUse发生在工具执行后,并提供停止循环与提示上下文的示例。适合梳理Agent动作的控制与记录边界;所列事件受CLI版本影响,本批没有运行Hook、改变权限或安装可选付费组件。
知识资料|发布日期未知。Matt Pocock的公开SKILL文件先固定比较点,再寻找需求与项目标准,分别评估规范违背、需求遗漏和范围扩张,并把两类发现保留为独立报告。适合避免代码规范通过掩盖需求未完成;本批未执行审查、调用模型或启动子Agent,缺失需求时须明确记录。
人工整理|2019-04-25的历史方法文章,所选前两步要求先检查数据分布、重复、损坏与标签,再搭建简单模型的训练和评估通路;用初始损失、单批过拟合、输入影响和下降曲线验证是否值得扩大实验。可作训练正确性排查清单。经验及示例代码只按作者历史建议保留,本批未训练、执行文中API或复验效果,不输出当前库默认值、性能保证或SOTA结论。
人工整理|团队原项目把语言指令转为策略代码,调用感知/控制接口并分层补充函数。所核tabletop_ui与fgen静态文本显示对象查询、条件判断、几何辅助函数及控制调用的分工,可参考代码接口与提示示例的审查。原示例有不一致:紫碗放蓝碗的指令,实际说法/调用使用粉碗;本条保留问题,不改外部源码。本人主页精确自链jackyliang42,2项独立团队作品核身份。未执行模型、Colab、互动demo或机器人;数据与效果为历史研究报告,贡献保留全部共同作者边界。
人工整理|MeshfreeFlowNet共同署名项目用U-Net式上下文网络产生潜在网格,再以连续解码MLP按时空坐标采样物理场,并加入PDE约束;原Figure 1对照低分辨率输入与高分辨率预测,可作物理场超分辨率和科学可视化研究参考。128GPU、96.80%扩展效率及少于4分钟训练是作者特定集群实验,未独立核验。保留9位共同作者,只读项目文字与静图,未读整篇PDF、运行代码或播放GIF/视频;不是普通照片放大、影视插帧或商业CG流程,项目发布日期未知。
人工整理|文字操作文档。n8n的具体设置文档说明从AI Agent的Tools面板添加Human review通道,再把需要审核的工具接入;审批内容可用$tool.name与$tool.parameters显示动作和输入,系统提示要说明拒绝后如何处理。适合设计发送消息、改记录等Agent动作的人工确认步骤。本批只阅读操作文档,未启动工作流、连接消息通道或调用模型;页面相对更新信息不作为原始发布日期,日期未知。
知识资料|来源仅提供发布日期2026-08-24,精确时刻未知。宝玉用自己的功能开发案例说明先比较可行性方案,再写设计文档、反复调整高保真原型,最后让实现遵循文档并做人类体验测试。适合检查跨Agent会话如何传递决策与验收标准;这是作者项目复盘,提效与模型能力未独立核验,本批没有转录媒体、开发功能或执行部署。
知识资料|发布日期未知。AI Jason的README区分代码运行、测试、验证和交付的harness,与共享文件知识库上的调查、执行及记录循环,并说明setup-codebase-harness和new-loop两个入口的产物。适合理解Agent项目准备与知识沉淀的关系;课程与云资源另有费用,本批未安装插件、启动循环或创建调度。
知识资料|来源仅提供发布日期2025-10-17,精确时刻未知。Armin Ronacher讨论以Pyodide运行临时代码,通过外部受控文件入口提供资料,并用步骤缓存与队列恢复长任务;正文给出worker通信和状态缓存的简化代码。适合学习工具沙箱、资源入口及任务恢复如何连接;这是作者实验记录,本批没有安装运行时、联网执行代码或改变隔离设置。
人工整理|Merve的卫星建筑实例分割配方展示COCO多边形转二值mask、图/框/mask同步缩放与归一化、懒预处理及变长标签组批,适合标注与mask资产准备参考。pixel_mask表示真实像素与padding区域,不能当目标mask。评价把置信度>.5的建筑实例合成并集计算IoU,不能完整衡量实例切分,空GT样本被跳过。原文称15轮约1小时,代码为10轮;文字提Trackio,训练参数未设置report_to。两张原缓存图来自不同场景,不能当同图前后或准确率证明。本次未安装、登录、下载模型/数据集、训练、推理或上传,未验证运行成本及卫星素材商用许可;日期未知。
人工整理|合作研究公开方法页,Jim Fan列Equal Advising。项目把自动课程、可检索的代码技能库和迭代提示连在一起,用环境反馈、执行错误与自验证来修订程序;组件图展示任务循环和技能添加/检索,可作Agent状态及反馈设计的学习参考。使用Minecraft与黑箱GPT-4是原方法条件,未认定运行免费。引用年份2023不当网页发布时间;本批未运行游戏、模型、工程或影片,不认证排名、成绩倍数或最新能力,团队作者不自动加入推荐名单。
知识资料|发布日期未知。Cole Medin公开的agents.py定义任务名称和到期日参数,把模型tool_calls分发到创建任务函数,再将工具结果加入会话并请求第二次模型回答。适合学习外部工具调用的基本消息往返;这段代码会写入Asana且需要模型与服务授权,本批只读源文件,没有调用模型、创建任务或读取.env。
知识资料|来源仅提供发布日期2025-11-21,精确时刻未知。Armin Ronacher总结保持系统提示与工具定义稳定、将动态信息后置、在工具返回时补充任务状态,以及对失败步骤和输出工具进行观察的经验。适合规划Agent上下文和验证记录;正文明确评估仍困难,本批未沿用模型排行榜或成本结论,也没有运行模型或发送邮件。
人工整理|开源项目文档。Zara Zhang的Codebase to Course面向用AI编程的非技术作者,说明以单页HTML组织项目课程、真实代码与白话说明、数据流可视化和应用型测验。适合接手项目时设计知识交接与学习路线;README强调引用原代码而非改写简化,但本批没有生成课程或验证输出质量。未安装、运行代码或调用模型,原始发布日期未知。
知识资料|发布日期未知。Sam Witteveen的smol_multiagent.py为搜索子Agent配置网页搜索和读取工具,再用ManagedAgent交给管理CodeAgent,并给子Agent设置步数上限。适合学习任务分工与工具边界的代码结构;示例使用托管模型和网页读取服务,费用及API版本另核,本批没有执行查询或创建子Agent。