跳到正文

首页

3 条
清除筛选按发布时间 · 最新在前
发布时间未知
  1. Lilian Weng|本人博客 RSS发布时间:未知未评分
    模型与能力 · 图文

    Lilian 的 Scaling Laws, Carefully:分配方法与拟合边界

    人工整理|2026-06-24原文所选Chinchilla与拟合限制段,讨论固定模型/数据或算力条件下怎样观察loss,并提醒数据有限、重复、噪声、测量精度和拟合区域会影响外推。Hoffmann等2022的IsoFLOP三联图在原文注明来源,Lilian的综述与引用图分别署名。可用来整理实验设计及资源分配问题,不能当本任务的训练预算报价、实测最优配比或所有下游能力保证。本批未训练、运行toy滑块/模拟或复验计算;RSS时间的零点不补成实际发表时刻。

  2. Chris Olah|写作目录变化发布时间:未知67
    模型与能力 · 图文

    Chris Olah 的 LSTM 图解:状态通路与逐步门控

    人工整理|本人2015-08-27历史文章所选核心段,解释贯穿时间的细胞状态,以及遗忘、写入、状态更新和输出如何分工。原链静图以配色、箭头和淡化相邻模块突出当前单元,可用于序列模型入门及技术图解的层次设计。本人about精确自链ch402,两篇原文支持既有推荐对象关联;引用和致谢不增加推荐名单。本批未训练或运行LSTM、复验梯度/性能,2015的流行度与预测不作2026现状;只看所列一图,不声称核完整课程。

  3. Chris Olah|写作目录变化发布时间:未知72
    模型与能力 · 图文

    Chris Olah 的表示可视化:总览、单点查询与降维限制

    人工整理|本人2015-01-16文章所选段比较输入和隐藏层表示,并讨论高维数据界面需要总览与单点查询;二维坐标轴不能直接当有明确语义的数值。所列原图将网络层和降维视图对应,可用于组织模型解释或数据探索界面。基本降维方法与文献不是作者独创,保留贡献边界。本批未操作hover/筛选、运行t-SNE或神经网络,图不独立证明全局距离、训练效果或唯一的数据结构解释;历史论述不作最新模型事实。