个人简介

关于我

我是北京大学软件工程硕士研究生,目前的研究覆盖工具调用智能体的强化学习、LLM 评测与奖励建模、扩散语言模型,以及多模态与具身智能。

我的研究主线是推动大模型从‘生成答案’走向‘可靠行动’:探索自回归与扩散式模型如何从可验证反馈中学习,在工具、视觉与真实环境中持续改进,并将能力突破转化为可衡量的实际价值。

现于腾讯 CSIG 优图实验室从事 Code Agent 后训练研究。

2027 年 7 月可入职 大模型算法研究员 · 研究科学家
中国大陆 · 中国香港 · 新加坡
01

研究方向

从失效模式出发,连接训练、评测与系统。

01 模型层

基座模型与后训练

研究训练目标与推理方法,在提升模型能力的同时,不让聚合分数掩盖真实失效模式。

监督微调偏好优化扩散语言模型
02 行动层

智能体与强化学习

面向需要与环境交互的智能体,研究信用分配、工具调用与奖励设计,而不仅是文本生成。

工具调用GRPO信用分配
03 可信层

模型评测与奖励建模

关注稳健的 LLM 裁判、长文本评测、不确定性,以及真正反映用户偏好的奖励模型。

LLM 裁判过程奖励模型长文本
04 感知层

多模态、VLM 与具身智能

通过视觉反馈与机器人奖励模型,将语言模型的推理能力连接到感知与行动。

视觉语言模型视觉反馈机器人奖励
02

最新动态

研究、论文与职业进展。

  1. 我们的论文 Length-Adaptive Decoding for Masked Diffusion Machine Translation 被 EMNLP 2026 主会接收,论文、代码、数据与模型权重现已公开。

  2. 我目前在腾讯 CSIG 优图实验室从事 Code Agent 后训练相关工作。

  3. 我们的论文 RefineSVG 被 CCF-A 会议 ACM Multimedia 2026 接收。

  4. 我们发布了关于工具调用强化学习、扩散语言模型推理和机器人奖励建模的新工作。

  5. 我加入腾讯,从事多语言大模型研究与智能体系统相关工作。

  6. 我在北京大学开始攻读硕士学位。

03

论文与预印本

按研究主题筛选,点击论文查看详情。

显示全部 9 篇论文。

NeurIPS '26 CCF-A 在审

SLCA-GRPO: Resolving Cross-Segment Credit Misattribution in Tool-Calling RL

Yan Zhan, Shaobo Liu, Qiunan Liu, Yuanjun Shi, Siqi Xu, WeiYi Hou, Xiang Xu, Zekang Li, Weizhou Pan, Jiahong Yan

Segment-Locked Credit Assignment 将执行奖励分配给工具片段、将偏好奖励分配给总结片段,从而减少工具调用强化学习中的跨片段信用污染。

投稿至 NeurIPS 2026

AAAI '27 CCF-A 在审

EAGLE: Entropy-Adaptive Gating of Pointwise Scores for Pairwise LLM Judges

Ziwei Yin, Shangyi Guo, Yinan Shao, Zhiheng Duan, Yan Zhan, Xin Wang, Bo Jia, Renzhao Liang, Yunze Song, Zhongkuan Mao, Yidong Wang, Yi Zhang, Yong Dai, Rongye Shi

提出选择性排序框架,先使用高效的点式评分,仅在接近并列且存在歧义的区间内调用成对比较。

投稿至 AAAI 2027

AAAI '27 CCF-A 在审

AgreeJudge: Predicting Cross-Rubric Support for Frozen LLM Judges

Ziwei Yin, Yuren Ban, Bo Jia, Xin Wang, Renzhao Liang, Yan Zhan, Yunze Song, Zhongkuan Mao, Yidong Wang, FaQiang Qian, Yi Zhang, Yong Dai, Rongye Shi

为冻结的 LLM 裁判预测跨评分准则支持度,在不改变原始判决的前提下改善置信度对齐与选择性复核。

投稿至 AAAI 2027

AAAI '27 CCF-A 在审

Decoupling Localization and Scoring in Long-form Reward Models

Ziwei Yin, Jiawei Zhang, Lu Zhang, Yunze Song, Renzhao Liang, Yan Zhan, Xin Wang, Bo Jia, Zhongkuan Mao, Mingyu Pei, Yidong Wang, Yi Zhang, Yong Dai, Rongye Shi

系统研究 23 种聚合规则,发现错误定位与影响评分几乎是相互独立的能力,应当分别评测和建模。

投稿至 AAAI 2027

AAAI '27 CCF-A 在审

DECAF: Decoupling Answer Correctness from Reasoning Presentation at the Parameter Level via Counterfactual Adversarial Fine-tuning

Ziwei Yin, Bingrun Chen, Yan Zhan, Renzhao Liang, Bo Jia, Xin Wang, Yunze Song, Zhongkuan Mao, Yidong Wang, Rongye Shi

通过反事实掩码视图与交叉监督分别训练过程评分器和答案评分器,降低误导性推理表达压过客观答案正确性的风险。

投稿至 AAAI 2027

NeurIPS '26 CCF-A 在审

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

提出多范式机器人奖励建模框架,使用 POISE 模块校准点式分数,使其遵循更可靠的成对偏好关系。

投稿至 NeurIPS 2026

“在审”论文按投稿会场展示;CCF 标签仅表示会场等级。等级依据中国计算机学会第七版推荐目录。 查看目录

04

行业经历

把研究方法落到真实数据、模型与系统。

腾讯 CSIG · 优图实验室

大模型算法研究实习生

中国北京 · 现场办公

在腾讯优图实验室从事 Code Agent 后训练研究,重点关注强化学习与工具调用智能体行为。

Code Agent后训练RL工具调用CSIG优图实验室

腾讯 PCG · QQ

大模型算法研究实习生

中国深圳 · 现场办公

面向 QQ 海外版实时翻译,构建覆盖 13 种欧亚语言、约 100 万样本对的多语种翻译语料,完成数据筛选与清洗、低资源语对蒸馏补齐、NER 实体修复、4B 级基座评测与 SFT。模型域内性能提升约 10 个百分点,并在 FLORES-200 与 WMT25 上达到更大规模 MoE 翻译基线的水平。

1M训练样本对13种语言+10pp域内提升

完美世界

NLP 算法实习生

中国北京 · 现场办公

研发面向玩家社区内容治理的大模型广告语识别系统,结合检索增强生成与 LoRA 微调,并通过 vLLM 部署高效推理。系统 F1 达到 85%,用于小时级离线批量识别。

85%F1 分数RAG+ LoRAvLLM推理部署
05

教育背景

点击学校名称或校徽标识访问官方网站。

北京大学

预计毕业

软件工程硕士

GPA:3.71/4.0。课程包括机器学习、自然语言处理、大语言模型开发与应用、人工智能实践以及算法分析与设计。

GPA 3.71 / 4.0预计 2027 年 6 月毕业

数字媒体技术学士

总排名 2/37,其中 2022–2023 学年排名第 1。

总排名 2 / 372022–2023 学年 1 / 37
06

荣誉与奖项

竞赛、奖学金与学生工作荣誉。

北京赛区高教主赛道一等奖

第八届中国国际“互联网+”大学生创新创业大赛

全国总决赛二等奖、三等奖

全国大学生数字媒体科技作品及创意竞赛

二等奖

2021 年全国模型大赛

学业卓越奖学金

北京林业大学

优秀学生奖学金

北京林业大学

文体优秀奖学金

北京林业大学

三好学生

北京林业大学

优秀学生组织干事

北京林业大学