Lau Luk Peter, Chen
Logo EECS, UC Berkeley

I do RL and Optimization, with application to LLM post training and generative models. Currently, I'm very fortunate to work with Dawn Song and Sergey Levine.

I also work under Wotao Yin on post training. I did my undergrad at Columbia, advised by Andrew Blumberg and Tianyi Lin.


Education
  • University of California, Berkeley
    University of California, Berkeley
    Ph.D. in Computer Science
    May. 2031
  • Columbia College, Columbia University
    Columbia College, Columbia University
    B.A. in Mathematics, Computer Science
    May. 2026
Teaching & Service
  • TA for Analysis & Optimization (Sp 24/Fa 24/Sp 25/Fa 25/Sp 26)
  • Reviewer for NeurIPS, ICLR, ICML, AAAI, TMLR
Selected Publications (view all )
Two-Fidelity Best-Action Identification for Stochastic Minimax Tree
Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

Peter Chen, Xi Chen

Advances in Neural Information Processing Systems 39 (NeurIPS 2026)

Two-Fidelity Best-Action Identification for Stochastic Minimax Tree

Peter Chen, Xi Chen

Advances in Neural Information Processing Systems 39 (NeurIPS 2026)

Reward-free Alignment for Conflicting Objectives
Reward-free Alignment for Conflicting Objectives

Peter Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

Proceedings of the International Conference on Machine Learning (ICML 2026) Oral

Reward-free Alignment for Conflicting Objectives

Peter Chen, Xiaopeng Li, Xi Chen, Tianyi Lin

Proceedings of the International Conference on Machine Learning (ICML 2026) Oral

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

Proceedings of the International Conference on Learning Representations (ICLR 2026)

Exploration vs Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward

Peter Chen, Xiaopeng Li, Ziniu Li, Wotao Yin, Xi Chen, Tianyi Lin

Proceedings of the International Conference on Learning Representations (ICLR 2026)

ComPO: Preference Alignment via Comparison Oracles
ComPO: Preference Alignment via Comparison Oracles

Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

ComPO: Preference Alignment via Comparison Oracles

Peter Chen, Xi Chen, Wotao Yin, Tianyi Lin

Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators
GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

Jiacheng Guo$^*$, Ling Yang$^*$, Peter Chen$^*$, Qixin Xiao$^*$, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

Advances in Neural Information Processing Systems 39 (NeurIPS 2026)

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

Jiacheng Guo$^*$, Ling Yang$^*$, Peter Chen$^*$, Qixin Xiao$^*$, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

Advances in Neural Information Processing Systems 39 (NeurIPS 2026)

All publications