Wener Notes

OCR Awesome

约 2 分钟阅读
标签:模型光学字符识别Document Understanding资源精选

OCR、文档解析、版面分析、表格和公式识别资源索引。

OCR Models

releasemodelparams
2026-02GLM-OCRHuggingFaceHF:THUDM/glm-ocrhuggingface.co · huggingface.co/THUDM/glm-ocr0.9B
2026-01DeepSeek-OCR-2-3BHuggingFaceHF:deepseek-ai/deepseek-ocr-2-3bhuggingface.co · huggingface.co/deepseek-ai/deepseek-ocr-2-3b3B
2026-01PaddleOCR-VL-1.5HuggingFaceHF:PaddlePaddle/PaddleOCR-VL-1.5huggingface.co · huggingface.co/PaddlePaddle/PaddleOCR-VL-1.50.9B
2026-01LightOnOCR-2-1BHuggingFaceHF:lightonai/LightOnOCR-2-1Bhuggingface.co · huggingface.co/lightonai/LightOnOCR-2-1B1B
2025-10olmOCRGitHuballenai/olmocr7B
2025-07dots.ocrGitHubXiaohongshu/Dots-OCR1.7B
2024-09GOT-OCR2.0HuggingFaceHF:stepfun-ai/GOT-OCR2_0huggingface.co · huggingface.co/stepfun-ai/GOT-OCR2_0580M

Document Understanding

Layout Analysis 与 PDF Toolkit

评估关注点

  • 文本识别:字符准确率、CER、语言和字体覆盖。
  • 版面:标题、段落、表格、公式、图片和阅读顺序。
  • 结构化输出:Markdown、JSON、HTML、坐标和 schema 稳定性。
  • 复杂文档:扫描件、手写、低清晰度、多栏、旋转、印章和中英文混排。

关联信息

反向链接、本文链接的其他页面和外部资料。

反向链接

  • AI Model
    笔记 · OCR

    AI Model Awesome 总索引 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR · ASR / STT · TTS · VAD · 音乐生成 · VLM / MLLM / Vision · Agent 与 Coding

  • AI Model Awesome
    笔记 · OCR 与文档理解

    按模型能力和使用场景组织的 AI 模型资源索引,保留模型架构、厂商、版本、推理资源、量化、微调和扩散模型历史资料。新增内容优先写入对应专题页面。 · LLM 与开放模型 · 图像生成 · 视频生成 · OCR 与文档理解 · ASR / STT

References

GitHub13 条
HuggingFace9 条
最近更新commit 42c1983Edit

On this page