> 数据图表谁能回答Qwen3-Omni 采用 Thinker-Talker MoE 架构统一多模态理解与实时生成
2026-6-2 端到端全模态模型支持流式输入输出,降低了交互延迟。为了减少模态转换带来的性能损耗,Qwen3-Omni 采用 Thinker-Talker 的 MoE 架构,原生支持文本、图像、音频、视频的同步处理与流式输出。官方数据显示,其端到端音频对话延迟为 211 毫秒,视频对话延迟为 507 毫秒。这种设计使模型可以边接收输入、边生成输出,交互从轮次式问答转向更连续的对话体验。