
transcript
show notes
百度开发的 Unlimited OCR 模型,旨在解决传统端到端 OCR 在处理长文档时产生的显存占用高和推理速度慢的问题。核心创新在于提出了 参考滑动窗口注意机制 (R-SWA),它模仿人类“工作记忆”模式,使解码器仅关注全部视觉参考和有限的近期输出上下文。这种设计实现了恒定的 KV 缓存,确保模型在单次前向传播中处理数十页文档时,推理延迟和显存需求不再随长度增长。实验结果显示,该模型在 OmniDocBench 基准测试中达到了行业领先水平,显著超越了其基础模型 DeepSeek OCR。此外,这种机制表现出极佳的泛化潜力,未来有望应用于语音识别和翻译等其他长序列任务。该研究为实现真正意义上的一键式长文本解析提供了高效且低成本的架构方案。