神龙烈焰在吹雪 / douyin· 神龙烈焰在吹雪·发布时间:
图文TITO 是什么:Miles 如何保持多轮 AI 智能体训练轨迹一致
蒸!多轮智能体轨迹的蒸馏与强化学习。TITO 是什么 在智能体强化学习(Agentic RL)中,一次 rollout 往往包含多轮模型生成、工具调用和环境反馈。Token-In-Token-Out(TITO)要求:上一轮的完整 Token
内容导读
这篇解读说明,TITO 要求上一轮的完整模型 token 序列原样成为下一轮提示词的开头,保证训练使用的上下文与实际推理一致。满足这一条件,多轮交互可拼成每个任务一个训练样本,减少训练计算量;上下文不一致则可能引发策略梯度异常和训练震荡。文中以 Miles 为例:为每条轨迹保留独立推理会话,只追加新消息和 token,并用增量分词避免改写历史序列。
继续看关键要点
- 重新分词、聊天模板裁剪历史推理、工具调用重新序列化,都可能破坏轨迹一致性;即使 JSON 语义不变,空格、换行和键顺序变化也会影响 token 序列。
- 文中给出的验证方式是:交互轨迹结束后,对实际 token 缓冲区与完整消息渲染结果做结构、文本双重比较,再通过 CPU 快速测试和 GPU 端到端推理验证。
来源:神龙烈焰在吹雪 / douyin · douyin.com