ruanyf-weekly:11064 · 2026 年收录
[AI相关] 新OCR模型发展的真快啊
我最近在关注RAG,接触到很多OCR相关的小模型,现在的模型已经可以直接输出格式化的文本了,相当方便 模型 | 出品方 | 发布时间 | 参数量 | 核心亮点 | 中文支持 - | -- | -- | -- | -- | -- Monkey
被谁收录过
- [AI相关] 新OCR模型发展的真快啊 2026-08-07
投稿原文(节选)
我最近在关注RAG,接触到很多OCR相关的小模型,现在的模型已经可以直接输出格式化的文本了,相当方便 模型 出品方 发布时间 参数量 核心亮点 中文支持 MonkeyOCR 华中科技大学 & 金山办公 2026年1月 (首次发布)2026年7月 (中文优化更新) 未明确 复杂表格解析 (精度超90%) 原生支持 GLM-OCR 智谱AI 2026年2月3日 0.9B 极致轻量高效,支持多令牌预测,SOTA性能 原生支持 HunyuanOCR 腾讯 2025年11月25日 1.0B 端到端专家模型,推理速度快,支持14种语言 原生支持 Qianfan-OCR 百度 2026年3月19日 4B 端到端统一模型,Layout-as-Thought机制,长上下文 原生支持 MinerU 上海AI Lab 2024年7月5日 (首次开源) 1.2B 一站式工具链,生态成熟,可集成第三方OCR引擎 原生支持 Hiro-MOSS-OCR PatSnap (智慧芽) 2026年5月26日 0.3B 超轻量,面向块级文档理解,结构化输出 原生支持 这是我最近测试的中文ocr,百度千帆效果比较好,但是比较大,日常用GLM-OCR 效果算是比较好的了,minerU本机部署去年要20GB,现在大概1G的量化模型都可以达到去年的效果了,直接输出markdown table用html输出,效果还不错,发展神速 当然 ,闭源的Mistral OCR 3 效果也很牛逼,但是如果不是复杂的表格,这些小模型够用了