Zheng Wang (汪政)



Bio

Zheng Wang is a Research Scientist in the AI & Compute Foundation organization at Meta. His research focuses on LLM Infra and system optimization. His recent work includes LLM pretraining performance optimization on AMD GPUs and post-training infra for large-scale agentic RL.

He received his Ph.D. in computer science from UC San Diego, where he worked on high-performance system design and end-to-end optimization for large-scale LLMs and recommendation models, under the supervision of Prof. Yufei Ding.

Publication

[ICML’26] Zaifeng Pan, Yipeng Shen, Zhengding Hu, Zhuang Wang, Aninda Manocha, Zheng Wang, zhongkai yu, Yue Guan, Yufei Ding. ScaleSim: Serving Large-Scale Multi-Agent Simulation with Invocation Distance-Based Memory Management. [Link]

[NeurIPS’25] Yue Guan, Changming Yu, Shihan Fang, Weiming Hu, Zaifeng Pan, Zheng Wang, Zihan Liu, Yangjie Zhou, Yufei Ding, Minyi Guo, Jingwen Leng. Yggdrasil: Bridging Dynamic Speculation and Static Runtime for Latency-Optimal Tree-Based LLM Decoding. [Link]

[ATC’25] Yuke Wang, Boyuan Feng, Zheng Wang, Guyue Huang, Tong Geng, Ang Li, Yufei Ding. GMI-DRL: Empowering Multi-GPU Deep Reinforcement Learning with GPU Spatial Multiplexing. [Link]

[OSDI’2025] Zheng Wang, Anna Cai, Xinfeng Xie, Zaifeng Pan, Yue Guan, Weiwei Chu, Jie Wang, Shikai Li, Jianyu Huang, Chris Cai, Yuchen Hao, Yufei Ding. WLB-LLM: Workload-Balanced 4D Parallelism for Large Language Model Training. [Link]

[MLSys’2025] Zaifeng Pan, Yitong Ding, Yue Guan, Zheng Wang, Zhongkai Yu, Xulong Tang, Yida Wang, Yufei Ding. FastTree: Optimizing Attention Kernel and Runtime for Tree-Structured LLM Inference [Link]

[ATC’2024] Zheng Wang, Yuke Wang, Boyuan Feng, Guyue Huang, Dheevatsa Mudigere, Bharath Muthiah, Ang Li, Yufei Ding. OPER: Optimality-Guided Embedding Table Parallelization for Large-scale Recommendation Model. [Link]

[ASPLOS’2024] Zheng Wang, Yuke Wang, Jiaqi Deng, Da Zheng, Ang Li, Yufei Ding. RAP: Resource-aware Automated GPU Sharing for Multi-GPU Recommendation Model Training and Input Preprocessing. [Link]

[ASPLOS’2024] Boyuan Feng, Zheng Wang, Yuke Wang, Shu Yang, Yufei Ding. ZENO: A Type-based Optimization Framework for Zero-Knowledge Neural Network Inference. [Link]

[ATC’2023] Yuke Wang, Boyuan Feng, Zheng Wang, Guyue Huang, Yufei Ding. TC-GNN: Bridging Sparse GNN Computation and Dense Tensor Cores on GPUs. [Link]

[OSDI’2023] Yuke Wang, Boyuan Feng, Zheng Wang, Tong Geng, Ang Li, Kevin Barker, Yufei Ding. MGG: Accelerating Graph Neural Networks with Fine-Grained Intra-Kernel Communication-Computation Pipelining on Multi-GPU Platforms. [Link]

[ISCA’2023] Siqi Li, Fengbin Tu, Liu Liu, Jilan Lin, Zheng Wang, Yangwook Kang, Yufei Ding, Yuan Xie. ECSSD: Hardware/Data Layout Co-Designed In-Storage-Computing Architecture for Extreme Classification. [Link]

[SC’2022] Zheng Wang, Yuke Wang, Boyuan Feng, Dheevatsa Mudigere, Bharath Muthiah, Yufei Ding. EL-Rec: Efficient Large-scale Recommendation Model Training via Tensor-train Embedding Table. [Link]

[ATC’2022] Boyuan Feng, Tianqi Tang, Yuke Wang, Zhaodong Chen, Zheng Wang, Shu Yang, Yuan Xie, Yufei Ding. Faith: An Efficient Framework for Transformer Verification on GPUs. [Link]


Selected Awards

[04/2023] 2023 Meta Fellowship Finalist [Link]