> 数据图表

想关注一下Artificial Analysis 智能指数文本模型评估 Artificial Analysis 智能指数视频模型评估

2026-6-5
想关注一下Artificial Analysis 智能指数文本模型评估  Artificial Analysis 智能指数视频模型评估
多模态能力正在从差异化卖点演变为大模型的基础能力标配,将成为 2025-2026年推动应用场景爆发的关键技术变量之一。当前头部模型已全面支持文本与图像输入,视频理解与生成能力正在快速普及,音频处理(语音识别、音乐生成)也在持续完善。2025 年 3 月 GPT-4o 更新图像生成能力后,ChatGPT 新订阅量激增证明了多模态融合不是锦上添花,而是直接驱动用户付费的核心功能。不同于以往文本用 GPT、图像用 DALL-E的拼接模式,GPT-4o 基于原生多模态架构,从同一模型直接生成文本和图像。根据前瞻产业研究院数据,2024 年中国多模态大模型市场规模达 156 亿元,预计到 2030 年将达到 969 亿元,复合增速超 65%。从应用场景看,多模态能力打开了数字人、视频创作、工业质检、医学影像分析等此前纯文本大模型无法渗透的场景,显著扩大了行业可寻址市场(TAM)。