#AI
FineBooks 测评 14 款开源 OCR 模型改善 AI 训练数据质量
Hugging Face 与 EleutherAI 联合发起 FineBooks 项目,系统测评 14 款开源 OCR 模型在古籍扫描页上的表现,旨在为开源语言模型训练数据「除锈」。Talkie 项目此前警示,用旧 OCR 文本训练语言模型,效率仅为人工转录的 30%。
团队在 2,165 页历史书籍扫描件上实测,最佳模型 dots.mocr(3B 参数)字符准确率达 97.6%,每千页成本 $1.94;次优的 OvisOCR2(0.9B)在 $0.46 极低成本下取得 96.9% 准确率。模型大小与质量不相关,9.7B 的 Qwen3.5-9B 准确率仅 94.9%。
项目组判断,当前水平可用于 AI 训练,但不足以支撑学术转录。
💡 为什么值得看FineBooks 针对旧 OCR 文本训练效率低(仅人工 30%)提出可规模化修复方案及成本限制。
查证
来源档案
The Decoder
专注于 AI 行业报道的独立科技媒体,本文为 FineBooks 项目的二次报道
数据引用清晰、来源可查——所有测评数据来自项目公开 leaderboard,指标定义明确;媒体本身非一手源,但所列数字经项目页交叉验证可信
延伸阅读
项目在 Hugging Face 公开了完整 14 款模型的逐项成绩与评估框架,适合技术选型参考