> 数据图表

你知道Loop Transformer 最直观的变化是输入的循环计算

2026-9-3
你知道Loop Transformer 最直观的变化是输入的循环计算
Loop Transformer 通过共享中间层权重,将参数规模与计算深度进一步解耦。 普通Transformer 在生成下一个 Token 前,需要依次经过固定的网络层,参数深度与实际计算深度基本对应。Loop Transformer 的核心是沿模型深度重复执行共享参数层,输入经过前置层后,同一组参数可以在内部重复执行多次,最后进入输出层完成 Token 生成。随着循环次数增加,模型独立参数量基本保持不变,但实际层计算和单位 Token 计算量相应提高,因此能够在较小参数增量下继续增加有效计算深度。 Loop Transformer 进一步增加了推理阶段的计算弹性。在训练能够覆盖不同循环深度的情况下,模型可根据任务复杂度配置不同的循环次数,简单任务使用较浅的计算深度,复杂任务增加循环计算,而无需同步扩大模型参数。与显式 CoT Scaling 相比,两者增加 Test-time Compute 的方式有所差异:CoT Scaling 主要通过增加推理 Token 延长显式推理链,计算深度 Scaling 则通过增加 Hidden State 在模型内部的迭代次数,提高 Token 输出前的计算深度。