地址: 泉州市刊舌入口209号 邮箱: deposed@gmail.com 工作时间:上午9点-下午8点

新闻动态

  • 首页
  • Our Portfolio
  • 6909个样本,Sarvam把印度22种语言的OCR做成了标尺

6909个样本,Sarvam把印度22种语言的OCR做成了标尺

2026-09-25

做文档智能的人都有个共同体会:英文OCR早就卷到头了,但一碰到印度语言,模型就开始"自由发挥"。不是漏字,就是凭空补字,一张1950年代的老报纸扫进去,出来的是半真半假的幻觉文本。 Sarvam Vision 2.1 这次更新的核心,就是冲着这类问题去的。它没有把力气花在刷英文榜单上,而是补了三块此前明显缺位的拼图:复杂表格解析、表单里的键值提取,以及印度手写体识别。 从用户反馈倒推的三个方向 上一版 Sarvam Vision 在2026年2月随主权模型系列一起发布,定位是通用视觉语言模型,但重心压在印度语言的OCR、表格解析和多语言视觉推理上。发布之后,团队收到的反馈集中在两条线上:一是某些能力压根没有,二是实际用起来不够顺手。 顺手这件事,他们从推理栈下手做了优化。结果是模型的服务价格比发布时宣布的更便宜,API也针对生产负载做了调整。能力这条线上,补的正是文档智能里最费劲的活:多页表格的结构化抽取、表单的键值提取、印度手写体识别。同时,此前被诟病的幻觉和不一致问题也做了处理。 架构没换,数据换了 架构延续了上一版的"harness加VLM"范式,语义布局解析器和指针阅读顺序网络是两个主要组件。模型本身能在页面级或文档级直接工作,但精度上的取舍决定了还是得靠harness兜底。 真正的变化在数据。团队为键值提取和印度手写体专门造了大规模高质量数据集,合成数据和真实数据都有。比如他们批量生成了多种语言的手写和印刷合成表单,又从网上抓来真实表单再合成填写,把方差拉高。印度手写体这块,他们用了视频等来源,因为里面天然包含大量手写内容。这些新数据源加上对原有训练语料的打磨,支撑了新能力的训练,也压住了老毛病。 数据到位之后,做的是大规模后训练:先监督微调,再上RLVR。 两个老榜单,一个新标尺 上一版报告的是olmOCR-Bench和OmniDocBench两个基准。这次继续报,但团队自己也承认,这两个榜单某种程度上已经饱和了。继续用的理由,是它们代表了社区认可的标准,能说明模型能力处在什么位置。 olmOCR-Bench测的是文档级表现,用通过/不通过的检查方式,覆盖arXiv数学、老扫描件数学、表格、退化的旧扫描、多栏页面、长串小字等类型。它查的是事实在不在,而不是细微偏差。这个基准官方只支持英文,但里面混了中文等污染样本。上一版因为模型只训了印度语言和英文,报的是过滤后的纯英文集;这次为了和竞品对齐,报的是官方全集。 OmniDocBench v1.6是个复合指标,由文本编辑距离、表格结构的TEDS、公式识别的CDM三项连续相似度构成。样本包括报纸、教科书、杂志、财报等,重点衡量结构保真度。 真正的新东西是Sarvam Indic OCR Bench。全球性的英文基准已经把结构和技术层面测得很充分了——布局保真、表格、数学、扫描质量,这些都不缺。缺的是一个严格评估22种印度官方语言准确率的基准。这次他们把这个基准放出来了,共6909个样本,其中6609个覆盖22种印度语言,300个是英文。它只盯一件事:语言准确率,每个样本都是为了稳健衡量字符和词准确率而挑选的。 样本来源很杂,报纸、宣传册、教科书、历史文稿都有,时间跨度从1800年一直到今天。这么做是因为多数印度语言在语言和文字上都经历过巨大变迁,只取当代样本测不出真实水平。基准托管在他们的huggingface上。 文档智能本来就不是单目标问题 一个系统好不好,要看好几个轴,而这些轴之间未必相关:转录1950年代的扫描件不出幻觉是一个轴,正确还原表格结构是一个轴,准确转录泰米尔语又是一个轴。Sarvam Vision 2.1 想站上的,就是这条多目标构成的帕累托前沿。 特别

about image

订阅我们的时事通讯并获取最新消息