Researcher & Ph.D. Student

Kangning Zhang

Ph.D. student, APEX Lab, Shanghai Jiao Tong University

I am a second-year Ph.D. student at the APEX Lab, Shanghai Jiao Tong University, advised by Prof. Weiwen Liu, Prof. Weinan Zhang, and Prof. Yong Yu.

I received my bachelor’s degree in Computer Science from the IEEE Pilot Class at Shanghai Jiao Tong University in 2024. My research mainly focuses on LLM-powered agents, tool calling, skills, and multimodal recommender systems. I am also interested in robotics learning.

I am always open to potential collaborations. If you are interested in working together, please feel free to reach out by email.

Education

Shanghai Jiao Tong University

Ph.D. in Computer Science

School of Computer Science

2024–Present

Shanghai Jiao Tong University

B.Eng. in Computer Science

IEEE Pilot Class

2020–2024

Internships

DeepExperience, Xiaohongshu

Research Intern

2025-Present

Research on agent tool calling and skills in the DeepExperience group.

Meituan

Research Intern

2024-2025

Research on generative recommendation with language models.

Shanghai Qi Zhi Institute

Research Intern

2023-2024

Research on robotics learning.

Huawei

Research Intern

2022-2023

Research on large language models for recommendation.

News

  1. HCGREC is accepted by CIKM 2026, recovering useful learning signals from unreachable rewards in generative recommendation.
  2. HARNESS-R1 is available on arXiv for learning to edit executable runtime harnesses from agent failure trajectories.
  3. VAD is available on arXiv for visual-evidence attribution in multimodal on-policy distillation.
  4. SKILLRISE is available on arXiv for cross-task skill evolution with agentic reinforcement learning.
  5. MOTOR and DIFFCOLD are accepted by ECML-PKDD (CCF-B) 2026.
  6. LOOPTOOL and the PROCESS REWARD MODEL SURVEY are accepted by ACL 2026 Main Conference.
  7. SWE-CYCLE is available on arXiv for benchmarking code agents across the complete issue resolution cycle.
  8. MUSEAGENT is available on arXiv for multimodal reasoning with stateful experiences.
  9. FINTS is available on arXiv for efficient inference-time personalization of LLMs.
  10. AUTOGRAPH is accepted by KDD 2025.
  11. ALIGNREC is available on arXiv and appears at CIKM 2024.
  12. 3D DIFFUSION POLICY is available on arXiv and appears at RSS 2024.
  13. CLICKPROMPT is available on arXiv and appears at WWW 2024.
  14. CODEAPEX is available on arXiv as a bilingual programming benchmark for large language models.

Publications

* indicates equal contribution. First/co-first-author papers are highlighted.
Google Scholar citations update automatically; last successful refresh Aug 19, 2026. GitHub stars refresh automatically.
arXiv 2026 MMSkills: Towards Multimodal Skills for General Visual Agents preview

MMSkills: Towards Multimodal Skills for General Visual Agents

Co-first Author

Kangning Zhang*, Shuai Shao*, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, and Yong Yu

arXiv preprint, 2026

MMSkills represents reusable multimodal procedural knowledge for visual agents with textual procedures, runtime state cards, and multi-view keyframes, then uses branch loading to consult relevant visual evidence during decision making.

arXiv 2026 Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories preview

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Co-first Author

Shuai Shao*, Kangning Zhang*, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, and Weinan Zhang

arXiv preprint, 2026

Harness-R1 trains a dedicated harness engineer to turn agent failure trajectories into validated executable runtime patches, improving target-agent success both before and after direct fine-tuning.

arXiv 2026 VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation preview

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

First Author

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, and Yong Yu

arXiv preprint, 2026

VAD attributes teacher corrections to controlled visual evidence and reconstructs student-anchored supervision targets for multimodal on-policy distillation, outperforming direct privileged-view distillation across six fine-grained visual benchmarks.

ACL 2026 LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls preview

LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls

First Author Main Conference

Kangning Zhang, Wenxiang Jiao, Kounianhua Du, Yuan Lu, Weiwen Liu, Weinan Zhang, and Yong Yu

Annual Meeting of the Association for Computational Linguistics (ACL), 2026

LoopTool closes the data-training loop for LLM tool use by evolving training data around a model's current weaknesses, improving robustness for multi-step tool-calling tasks.

CIKM 2026 Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation preview

Learning from Unreachable Rewards: Hint-Conditioned Reinforcement Learning for Generative Recommendation

First Author Accepted Paper

Kangning Zhang, Haotian Fang, Xukun Luo, Hao Yin, Yang Gao, Peng Yan, Weiwen Liu, Weinan Zhang, and Yong Yu

ACM International Conference on Information and Knowledge Management (CIKM), 2026

HCGRec diagnoses when finite rollout groups cannot reach the target item, supplies the shortest useful target-prefix hint, and separates supervised credit for hinted context from GRPO credit for sampled suffix actions, reducing zero-advantage training samples from over 70% to below 20%.

CIKM 2024 AlignRec: Aligning and Training in Multimodal Recommendations preview

AlignRec: Aligning and Training in Multimodal Recommendations

Co-first Author

Yifan Liu*, Kangning Zhang*, Xiangyuan Ren, Yanhua Huang, Jiarui Jin, Yingjie Qin, Ruilong Su, Ruiwen Xu, Yong Yu, and Weinan Zhang

ACM International Conference on Information and Knowledge Management (CIKM), 2024

AlignRec studies representation misalignment in multimodal recommendation and introduces alignment-aware training for stronger multimodal user-item features.

RSS 2024 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations preview

3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations

Yanjie Ze*, Gu Zhang*, Kangning Zhang, Chenyuan Hu, Muhan Wang, and Huazhe Xu

Robotics: Science and Systems (RSS), 2024

3D Diffusion Policy introduces compact point-cloud representations into diffusion-policy imitation learning for stronger robot manipulation generalization.

ECML-PKDD 2026 Learning ID-free Item Representation with Token Crossing for Multimodal Recommendation preview

Learning ID-free Item Representation with Token Crossing for Multimodal Recommendation

First Author CCF-B

Kangning Zhang, Jiarui Jin, Yingjie Qin, Ruilong Su, Jianghao Lin, Yong Yu, and Weinan Zhang

European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD), 2026

MOTOR replaces item ID embeddings with learnable multimodal tokens and a token-crossing network, reducing reliance on sparse ID features.

ECML-PKDD 2026 DiffCold: A Diffusion-based Generative Model for Cold-Start Item Recommendation preview

DiffCold: A Diffusion-based Generative Model for Cold-Start Item Recommendation

First Author CCF-B

Kangning Zhang, Yingjie Qin, Weinan Zhang, Yong Yu, and Jianghao Lin

European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD), 2026

DiffCold tackles cold-start recommendation with diffusion-based representation simulation, retrieval-enhanced aggregation, and representation alignment for cold items.

arXiv 2026 SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution preview

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, and Yongliang Shen

arXiv preprint, 2026

SkillRise unifies cross-task solving and skill-document curation within reinforcement learning, enabling efficient skill evolution and transfer across progressively related tasks.

arXiv 2026 SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle preview

SWE-Cycle: Benchmarking Code Agents across the Complete Issue Resolution Cycle

Hao Guan, Lingyue Fu, Shao Zhang, Yaoming Zhu, Kangning Zhang, Lin Qiu, Xunliang Cai, Xuezhi Cao, Weiwen Liu, Weinan Zhang, and Yong Yu

arXiv preprint, 2026

SWE-Cycle evaluates code agents across environment reconstruction, implementation, test generation, and a full-cycle issue-resolution task.

arXiv 2026 MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences preview

MuSEAgent: A Multimodal Reasoning Agent with Stateful Experiences

Shijian Wang, Jiarui Jin, Runhao Fu, Zexuan Yan, Xingjian Wang, Mengkang Hu, Eric Wang, Xiaoxi Li, Kangning Zhang, Li Yao, Wenxiang Jiao, Xuelian Cheng, Yuan Lu, and Zongyuan Ge

arXiv preprint, 2026

MuSEAgent distills interaction histories into stateful decision experiences and retrieves them through complementary search strategies for multimodal reasoning.

arXiv 2025 Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering preview

Fints: Efficient Inference-Time Personalization for LLMs with Fine-Grained Instance-Tailored Steering

Kounianhua Du, Jianxing Liu, Kangning Zhang, Wenxiang Jiao, Yuan Lu, Jiarui Jin, Weiwen Liu, Yong Yu, and Weinan Zhang

arXiv preprint, 2025

Fints performs inference-time personalization by selecting fine-grained, instance-tailored steering signals for dynamic user preferences and sparse personalization data.

ACL 2026 A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models preview

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

Main Conference

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, and Weinan Zhang

Annual Meeting of the Association for Computational Linguistics (ACL), 2026

This survey reviews process reward models across process data construction, reward modeling, test-time scaling, and reinforcement learning for large language models.

KDD 2025 An Automatic Graph Construction Framework based on Large Language Models for Recommendation preview

An Automatic Graph Construction Framework based on Large Language Models for Recommendation

Rong Shan, Jianghao Lin, Chenxu Zhu, Bo Chen, Menghui Zhu, Kangning Zhang, Jieming Zhu, Ruiming Tang, Yong Yu, and Weinan Zhang

ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD), 2025

This framework uses large language models to automate graph construction for recommendation, improving the graph learning substrate used by GNN-based recommenders.

WWW 2024 ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction preview

ClickPrompt: CTR Models are Strong Prompt Generators for Adapting Language Models to CTR Prediction

Jianghao Lin, Bo Chen, Hangyu Wang, Yunjia Xi, Yanru Qu, Xinyi Dai, Kangning Zhang, Ruiming Tang, Yong Yu, and Weinan Zhang

The ACM Web Conference (WWW), 2024

ClickPrompt adapts language models to CTR prediction by using CTR models as prompt generators, combining semantic and collaborative signals.

arXiv 2023 CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models preview

CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models

Lingyue Fu, Huacan Chai, Shuang Luo, Kounianhua Du, Weiming Zhang, Longteng Fan, Jiayi Lei, Renting Rui, Jianghao Lin, Yuchen Fang, Yifan Liu, Jingkuan Wang, Siyuan Qi, Kangning Zhang, Weinan Zhang, and Yong Yu

arXiv preprint, 2023

CodeApex is a bilingual benchmark for evaluating large language models on programming comprehension, code generation, and code correction.