基座模型与后训练
研究训练目标与推理方法,在提升模型能力的同时,不让聚合分数掩盖真实失效模式。
个人简介
我是北京大学软件工程硕士研究生,目前的研究覆盖工具调用智能体的强化学习、LLM 评测与奖励建模、扩散语言模型,以及多模态与具身智能。
我的研究主线是推动大模型从‘生成答案’走向‘可靠行动’:探索自回归与扩散式模型如何从可验证反馈中学习,在工具、视觉与真实环境中持续改进,并将能力突破转化为可衡量的实际价值。
现于腾讯 CSIG 优图实验室从事 Code Agent 后训练研究。
从失效模式出发,连接训练、评测与系统。
研究训练目标与推理方法,在提升模型能力的同时,不让聚合分数掩盖真实失效模式。
面向需要与环境交互的智能体,研究信用分配、工具调用与奖励设计,而不仅是文本生成。
关注稳健的 LLM 裁判、长文本评测、不确定性,以及真正反映用户偏好的奖励模型。
通过视觉反馈与机器人奖励模型,将语言模型的推理能力连接到感知与行动。
研究、论文与职业进展。
我们的论文 Length-Adaptive Decoding for Masked Diffusion Machine Translation 被 EMNLP 2026 主会接收,论文、代码、数据与模型权重现已公开。
我目前在腾讯 CSIG 优图实验室从事 Code Agent 后训练相关工作。
我们的论文 RefineSVG 被 CCF-A 会议 ACM Multimedia 2026 接收。
我们发布了关于工具调用强化学习、扩散语言模型推理和机器人奖励建模的新工作。
我加入腾讯,从事多语言大模型研究与智能体系统相关工作。
我在北京大学开始攻读硕士学位。
按研究主题筛选,点击论文查看详情。
显示全部 9 篇论文。
提出闭环视觉反馈框架,使多模态语言模型能够渲染、比较并迭代修正 SVG 输出,同时结合面向 SVG 的词表设计与智能体强化学习。
ACM Multimedia(ACM MM)2026
提出无需训练的 Entropy-Valley 方法,在去噪前选择掩码扩散模型的目标长度,无需额外长度预测器即可提升翻译充分性。
EMNLP 2026 主会
Segment-Locked Credit Assignment 将执行奖励分配给工具片段、将偏好奖励分配给总结片段,从而减少工具调用强化学习中的跨片段信用污染。
投稿至 NeurIPS 2026
在计算量对齐的实验中分析确定性 PRM 引导为何可能弱于简单的结果奖励重排,并定位中间状态信号衰减、多样性坍缩与读出误差。
投稿至 NeurIPS 2026
提出选择性排序框架,先使用高效的点式评分,仅在接近并列且存在歧义的区间内调用成对比较。
投稿至 AAAI 2027
为冻结的 LLM 裁判预测跨评分准则支持度,在不改变原始判决的前提下改善置信度对齐与选择性复核。
投稿至 AAAI 2027
系统研究 23 种聚合规则,发现错误定位与影响评分几乎是相互独立的能力,应当分别评测和建模。
投稿至 AAAI 2027
通过反事实掩码视图与交叉监督分别训练过程评分器和答案评分器,降低误导性推理表达压过客观答案正确性的风险。
投稿至 AAAI 2027
提出多范式机器人奖励建模框架,使用 POISE 模块校准点式分数,使其遵循更可靠的成对偏好关系。
投稿至 NeurIPS 2026
“在审”论文按投稿会场展示;CCF 标签仅表示会场等级。等级依据中国计算机学会第七版推荐目录。 查看目录
把研究方法落到真实数据、模型与系统。

大模型算法研究实习生
中国北京 · 现场办公
在腾讯优图实验室从事 Code Agent 后训练研究,重点关注强化学习与工具调用智能体行为。

大模型算法研究实习生
中国深圳 · 现场办公
面向 QQ 海外版实时翻译,构建覆盖 13 种欧亚语言、约 100 万样本对的多语种翻译语料,完成数据筛选与清洗、低资源语对蒸馏补齐、NER 实体修复、4B 级基座评测与 SFT。模型域内性能提升约 10 个百分点,并在 FLORES-200 与 WMT25 上达到更大规模 MoE 翻译基线的水平。

NLP 算法实习生
中国北京 · 现场办公
研发面向玩家社区内容治理的大模型广告语识别系统,结合检索增强生成与 LoRA 微调,并通过 vLLM 部署高效推理。系统 F1 达到 85%,用于小时级离线批量识别。
点击学校名称或校徽标识访问官方网站。
竞赛、奖学金与学生工作荣誉。
第八届中国国际“互联网+”大学生创新创业大赛
全国大学生数字媒体科技作品及创意竞赛
2021 年全国模型大赛
北京林业大学
北京林业大学
北京林业大学
北京林业大学
北京林业大学