> 数据图表请问一下DeepSeek-V3 在模型训练不同阶段的开销2025-3-1推理模型改变了原有大模型在预训练上 Scaling 的范式,将算力开销进一步向后训练和推理阶段转移。以 DeepSeek-V3 为例,我们看到其在预训练阶段的训练时间为 266.4 万中原证券综合其他