> 数据图表

一起讨论下通用大模型用于 OCR 易出现误读、过度推理与提示注入风险

2026-8-2
一起讨论下通用大模型用于  OCR  易出现误读、过度推理与提示注入风险
多模态结构限制其对字符级信息的精确保留能力。在模型结构层面,多模态大模型通常通过视觉 Transformer 对图像进行 patch 切分并映射至语义空间,该过程并非为字符级精确还原设计,可能导致字符信息在处理过程中出现模糊或丢失。同时,Attention 机制更侧重全局语义关联提取,对字符间距、版式结构及表格边界等局部信息的表达能力有限。此外,位置编码在高维空间中难以完全保留精确空间关系,使得结果难以进行逐字符校验与规则匹配,从而影响其在高精度场景中的可靠性。 大模型输出易受提示词与上下文扰动影响,关键场景仍需依赖确定性 OCR 能力。在实际应用中,大模型输出结果可能受到输入提示及上下文信息干扰,从而产生偏差或错误。在反欺诈、风险控制及身份核验等对准确性和可追溯性要求较高的场景中,这类不确定性将直接影响结果可信度。因此,在涉及财务数据、法律文本及身份信息等关键领域,行业仍倾向采用具备确定性输出与可校验机制的传统 OCR 技术体系,以保障结果的稳定与可追溯性。