> 数据图表

请问一下DeepSeek-V3 在模型训练不同阶段的开销

2025-3-1
请问一下DeepSeek-V3 在模型训练不同阶段的开销
推理模型改变了原有大模型在预训练上 Scaling 的范式,将算力开销进一步向后训练和推理阶段转移。以 DeepSeek-V3 为例,我们看到其在预训练阶段的训练时间为 266.4 万