> 数据图表谁知道使用 0.5GPU 分片的输出吞吐量为满 GPU 吞吐量的 77%2026-9-01) 中等规模参数模型(Llama 3.1 8B Instruct):在 64 个 GPU 的情况下,0.5 GPU 配置支持 8,768 个并发用户,占 GPU 总容量(10,200 个并发用户)的 86%实现 152,694 个token秒输出,达到满 GPU 吞吐量(198,680 个 token秒)的 77%。表明 GPU 分片仅会带来轻微的性能损失,但不会造成显著的容量损失。浙商证券综合其他