跳到正文

首页

5 条
清除筛选按发布时间 · 最新在前
10月8日周四
  1. Simon Willison / twitter发布时间:
    未分类 · 图文

    Simon Willison:Haiku 5.5 绘制骑车鹈鹕的表现明显优于 Claude Haiku 4.5

    Simon Willison 认为,Haiku 5.5 在绘制“骑自行车的鹈鹕”时明显优于 Claude Haiku 4.5。他称后者发布于近一年前,成本为前者的 10x,并附上了 Haiku 4.5 的尝试结果链接;这条短帖没有展开评测方法或其他任务的表现。

    仅基于配文;附链正文尚未取得;正式参考价值分;依据原始文字;已检查1幅静态图片评审副本;未评价完整视频、运动、剪辑或声音

10月7日周三
  1. Simon Willison / twitter发布时间:12
    未分类 · 视频

    Simon Willison 分享一个使用 Lilypond 的基准测试

    Simon Willison 分享了一个使用 Lilypond 的基准测试,但原帖未提供测试目标、评测方法或结果,相关链接内容也不在本次材料范围内。

    附链正文尚未取得,仅概括已获取文字

9月21日周一
  1. AI圈的那些事 / xiaohongshu发布时间:37
    编程与智能体 · 图文

    一日升一位:Step 5 Preview 升至 AA 全球开源模型第二名

    AI圈的那些事称,9月20日,阶跃星辰 Step 5 Preview 在 AA 综合智能指数 v4.3.2 的全球开源模型排名中,从第三升至第二。这一结果仅代表该评测体系,不同平台的结论可能存在差异。文中称模型已上线,面向软件工程、金融和 AI 编程场景;虽然被列入开源模型排名,对外开源仍是官方计划,日期为10月15日。

    仅基于配文整理

9月9日周三
  1. 思特沃克洞见 / wechat发布时间:57
    编程与智能体 · 图文

    真实项目 Design-to-Code 实测:Kimi K3、Claude Opus 5 与 GPT-5.6 Sol 对比

    这是一场在真实企业前端项目中的 Design-to-Code 对比实测:作者用 GitHub Copilot CLI、自定义 Agent、Skill 和 Figma MCP,让三款模型把 Figma 设计稿还原为受 React 19、VDS、CSS Modules、i18n 与三道门禁约束的页面。测试中 Kimi K3 和 Claude Opus 5 均通过门禁,视觉分数分别为 74.8 和 60.4;GPT-5.6 Sol 因编译错误无法运行。作者认为,截图与节点树交叉验证、主动管理上下文和强制自检,比单看生成速度更影响可交付性。

2016年5月18日周三
  1. Soumith Chintala关联|Newmu/dcgan_code 仓库更新发布时间:7
    应用落地 · 文本

    SVHN 半监督学习结果更新

    SVHN 的半监督学习结果已更新。