XINRAN DUAN / 返回总览
ANT GROUP · MULTIMODAL FOUNDATION MODEL V3

不是再做一个高级模型,
而是把高级能力稳定做进基模

我参与 V3 版统一合训,重点把对抗 OCR、细粒度感知与富文本理解等前沿探索能力,通过批量数据构造和 MOPD 蒸馏迁移到基础模型。

3 类高级能力对抗 OCR · 细粒度感知 · 富文本
Data → MOPD先规模化造数,再进行多教师在线蒸馏
统一基模兼顾能力覆盖、吞吐、成本和持续迭代

业务理解:单点 SOTA 不等于线上可用

高级模型适合探索能力上限,但大规模内容安全需要统一模型承担稳定吞吐。真正的问题是:如何保留专家能力,同时避免多域混训造成能力互相稀释、训练不稳定和迭代耦合。

对抗 OCR

处理旋转、扭曲、遮挡、谐形与图文组合攻击,不只识别干净印刷文字。

细粒度感知

关注局部区域、微小目标、属性与空间关系,降低“看见大概但答错细节”。

富文本理解

保留表格、列表、公式、版式与跨区域对应关系,让识别结果可继续推理和审核。

我的工作闭环:技术探索 → 批量造数 → MOPD → 基模回归

01 / FRONTIER

定义能力与难例

把“高级模型更强”拆成可测的能力维度、失败模式和目标输出格式。

02 / DATA FACTORY

规模化构造数据

围绕攻击变体、局部细节和复杂版式批量生成样本,再经教师与规则过滤。

03 / MOPD

多教师在线蒸馏

学生在自己的 rollout 上生成,路由到对应专家获得逐 token 稠密监督。

04 / REGRESSION

统一评测与回归

同时检查专项能力、通用能力和安全边界,避免“一个能力涨、其他能力掉”。

关键价值:把分散、昂贵、难部署的专家能力,变成统一基础模型可持续继承和迭代的能力资产。

公开技术参考:基模结构与 MOPD 能力整合

以下截图来自公开技术报告,用于解释通用机制,不代表蚂蚁内部模型结构、数据规模或训练配置。

MOPD 三阶段能力整合流程
MOPD 公开论文 Figure 1:共享 SFT 起点 → 独立领域教师 → 学生 rollout 上的多教师反向 KL 蒸馏。
为什么不用静态 SFT 就结束?

静态教师答案与学生推理时分布不一致;on-policy 让训练直接覆盖学生会走到的状态。

为什么适合多能力合训?

不同专家可以并行开发,再按任务路由整合,减少多域直接混训的相互干扰。

监督为什么更密?

教师在每个 token 上提供分布信息,比只有最终成败的序列级奖励更细。

Qwen3-VL 公开技术报告框架图
Qwen3-VL 技术报告 Figure 1:原生分辨率视觉编码器、DeepStack 与语言模型共同构成多模态基模。
基模不是纯语言模型外挂 OCR

视觉 token 的分辨率、层级特征注入和跨模态对齐,会共同决定 OCR 与细粒度感知上限。

公开报告的共同趋势

大量合成与筛选数据、强到弱蒸馏、专项能力训练,再回到统一模型评测。

我的关注点

不是复述架构,而是把高级能力转成可规模化的数据与训练信号。

Qwen3-VL 多语言 OCR 公开评测图
Qwen3-VL 技术报告 Figure 2:公开多语言 OCR 结果。这里用于说明 OCR 专项能力需要数据覆盖、视觉表征和后训练共同支撑。

合成 Case:复杂富文本中的对抗 OCR 与局部细节

下面是用于说明能力链路的公开展示型合成案例,不含任何内部数据。

PAID

INVOICE / 发票

MerchantNorthwind Lab
Serial No.A8-5Z7-0I
ItemVision Sensor × 2
Subtotal¥ 3,980.00
Tax¥ 238.80
Total¥ 4,218.80

任务:读取倾斜序列号,区分 Z/2、I/1,并保留表格与金额层级。

基础模型 / 蒸馏前Serial: A8-527-01 Total: ¥3,980.00 (混淆字符,并把小计当成总额)
专项教师信号OCR teacher → A8-5Z7-0I Fine-grained teacher → 定位 Serial 行与 PAID 印章 Rich-text teacher → 恢复 Subtotal / Tax / Total 层级
统一基模 / 能力蒸馏后{ "serial": "A8-5Z7-0I", "subtotal": 3980.00, "tax": 238.80, "total": 4218.80, "status": "PAID" }

Case 为网页合成示例,展示能力拆解和训练目标,不对应内部样本或实际模型输出。

与上一阶段工作的衔接

V2 / POLICY

动态规则 Agent

规则增删改写与 Teacher-Verifier 闭环,解决“策略变化后标签也要变化”。

V3 / CAPABILITY

统一基模合训

进一步解决“前沿专项能力怎样进入主模型并保持通用能力”。

BUSINESS

从规则适应到能力资产化

我对安全大模型的理解从数据规则层,延伸到模型能力整合与持续迭代层。

← 返回两页总览重新从 CausalChapter 开始 →