Jim Fan / X· Jim Fan(合作研究)·收录时间:
图文Eureka 合作研究:奖励代码的搜索、评估与反思
Jim Fan合作研究:Eureka奖励代码搜索与反馈
人工整理
人工整理|Jim Fan列Equal Advising的合作研究原页,说明以环境源码和任务描述生成奖励代码,再用GPU仿真评估候选并把训练统计作为奖励反思反馈;人的反馈也可修订奖励。配图是研究团队的反馈结构示意,可用于理解程序生成与评价闭环,不能由静图认证步态效果。原项目引用年份2023,网页发文日未知。GPT-4、仿真与GPU运行未证明免费,本批未调用模型、安装仿真器、播放影片或复验论文成绩;非Jim独作。
来源:Jim Fan / X · eureka-research.github.io