> 数据图表如何看待主要大模型 Agent 能力比较2026-9-5Fable 5 进一步提升长时间智能体和执行复杂专业任务的能力上限。模型在SWE-Bench Pro 智能体编程、GDPval-AA 知识工作和 Terminal-Bench 2.1 终端操作中分别取得 80.3%、1932 分和 88.0%,并在视觉理解、医疗和生物学等专业评测中明显领先 Opus 4.8。安全方面,Fable 5 面向通用用户增加了更严格的网络安全防护,在自动化红队测试中,其进攻性网络任务完成率仅为 5.4%,显著低于 Opus 4.8 的 56.6%。模型在保持较强专业能力的同时,对网络安全风险控制能力也得到大幅提升。国泰海通综合其他