探所 Curio 再探再报 了解探所 →
#AI

蚂蚁 OmniTable 获 VLDB 工业最佳论文

训练大模型之前,语料要先经过解析、清洗、去重、质量评分、Token 化等环节。规模到 PB 级后,数据工程师面对的是数百张表、不断添加的特征,以及少数几条异常数据就能让整批任务重跑。蚂蚁集团用一套统一宽表系统 OmniTable 来解决这个问题,论文获评 **VLDB 2026 工业赛道最佳论文**。

OmniTable 的核心思路是「逻辑统一、物理分离」:同一数据域在上层呈现为一张逻辑宽表,底层仍按规模、访问方式和引擎拆分;特征从脚本里的临时计算,变成带定义、版本、依赖和血缘的系统资产。论文披露系统已在生产环境管理 **超过 35 PB、3050 亿条以上**训练数据,覆盖 Web、代码、PDF 和 SFT 等数据域。

💡 为什么值得看数据工程侧罕见的工业化落地,提速 5.6 倍。

查证

来源档案

量子位

中文 AI 科技媒体,本篇为蚂蚁集团供稿、量子位获授权转载

内容源自蚂蚁官方供稿并附论文链接,可信度较高;但具体数据数字均为论文口径,未经独立第三方验证

延伸阅读

看论文原文 · qbitai.com 20 分钟
文中所有数字均来自正式论文,含算子融合、记录级容错、后台治理等完整评测,想核实细节可直接看 PVLDB Vol.19 原文
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store