多视觉技术驱动课堂教学评价;入选首批“人工智能+高等教育”典型案例。
MULTIMODAL LLM · AGENTIC AI · POST-TRAINING
从业务问题出发,
把能力做进模型。
我关注真实业务里“模型为什么还不能用”:把模糊需求拆成感知、结构、数据与训练问题,再用可扩展的 Agent 工作流和后训练方法形成闭环。
4.0 / 4.0硕士 GPA · 1/71
EMNLP 2026主会 · 第一作者 · Top 15%
ICLR 2026共同一作
教育与研究
北京师范大学 · 硕士GPA 4.0/4.0 · 排名 1/71 · 党支部书记
北京师范大学 · 学士GPA 3.8/4.0 · 排名 8/56 · 球队队长
多模态理解Agent WorkflowSFT / RL / Distillation模型安全
核心经历
递归知识结构化 Agent;较 Vanilla RAG 平均提升约 6 个点。
多模态自动分群训练 +4 点;长视频章节理解录用 EMNLP 2026。
从动态规则 Agent 延伸到 V3 多模态基模合训与能力蒸馏。
向下滚动:用三项重点工作看我的业务与模型方法论 ↓
BUSINESS → MODEL → RESULT
三项重点工作,一套问题解决方式
02 / 02
01 · 长视频理解EMNLP 2026 ↗
CausalChapter
- 业务判断
- 下游需要的不是局部 caption,而是可定位、可串联、可供分析的高层剧情结构。
- 模型方案
- 用干预后的预测变化找真实边界和关键历史上下文。
- 结果
- 95.36 → 116.88 CIDEr,同 Qwen 骨干 +21.52。
02 · 时序动作分割ICLR 2026 ↗
CurvSeg
- 问题判断
- 分类与定位需要相反的特征,但彻底解耦又会切断任务间的互补信息。
- 模型方案
- MoE 双专家解耦特征,以曲率作为几何信号恢复任务协同。
- 结果
- F1@50 63.6 → 65.5,共同一作。
03 · 基模合训ANT V3 ↗
前沿能力如何进入基础模型
- 业务判断
- 高级模型能解决单点难题,但无法直接承担大规模审核的成本、吞吐与统一迭代。
- 模型方案
- 批量构造对抗 OCR、细粒度感知与富文本数据,再以 MOPD 蒸馏到统一基模。
- 我的工作
- 技术探索 → 数据工程 → 能力蒸馏,参与 V3 版合训。
代表论文
EMNLP 2026CausalChapter · 第一作者ICLR 2026Curvature-Guided Task Synergy · 共同一作CCF-A 投稿中Self-Purifying Caching · 学生一作CHI 2025RemapVRSIGGRAPH 2024ST-4DGS《计算机科学》教学过程感知与分析 · 第一作者
荣誉与技能
奖项 4 次京师一等奖学金 · 三好学生 · 竞赛一等奖学金
竞赛 CCPC 区域赛铜奖 · iGEM 银奖 · 挑战杯银奖
技术 Python · C++ · PyTorch · SFT/RL · MOPD · 多模态数据构建