Jina AI / wechat· Jina AI·发布时间:
图文jina-ocr-v1:在低成本 GPU 上更快解析文档
内容导读
Jina AI 发布 jina-ocr-v1,将扫描页、照片或 PDF 转成 Markdown,保留表格和公式。它通过先预测、再验证后续文本加速;厂商单卡 L4 测试中,Eager 与 CUDA Graph 模式的最佳加速比分别为 1.95x 和 1.17x,收益随运行方式变化。可通过 API 调用或本地部署;本地推测加速需 vLLM 0.21 以上,权重采用 CC BY-NC 4.0,限非商业使用。
继续看关键要点
- 模型总参数为 3.4B,解码时每个模型 token 激活 570M 参数。Jina AI 报告其 OmniDocBench v1.6 得分为 91.14,olmOCR-Bench 得分为 83.4。
- 厂商在单张 A100、并发 32 下测得整页吞吐为 2.57 页/秒。对比显示,每秒生成的模型 token 更多,不一定解析更快:单页输出长度也会影响最终吞吐。
- 部署时,作者建议 Eager 模式使用 k = 3,CUDA Graph 模式使用 k = 1。FastMTP 需指定 method="eagle",注册辅助函数已处理;仅用 Transformers 加载不会启用该加速。
- 训练奖励按文本、公式、表格等项目的部分正确程度给分。多数检查项设有底线分,避免局部错误使整页训练信号归零;重复死循环则保留零分否决。
来源:Jina AI / wechat · mp.weixin.qq.com