Ax Dingwei Zhu, Zhiheng Xi, Shihan Dou, Yuhui Wang, Sixian Li, Junjie Ye, Honglin Guo, Shichun Liu, Chenhao Huang, Yajie Yang, Junlin Shang, Senjie Jin, Ming Zhang, Jiazheng Zhang, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui 5/7/2026

DVPO: Distributional Value Modeling-based Policy Optimization for LLM Post-Training

DVPO algorithm for stable LLM post-training via distributional value modeling, handling noisy supervision in RL settings.

Ax Leon G\"otz, Lars Frederik Peiss, Erik Sauer, Andreas Udo Sass, Thorsten Bagdonat, Stephan G\"unnemann, Leo Schwinn 5/7/2026

A Scalable Multi-Task Model for Virtual Sensors

Multi-task learning approach for virtual sensors using time series foundation models to predict signals from available measurements.

Ax Mingda Liu, Zhenghan Zhu, Ze'an Miao, Katsuki Fujisawa 5/7/2026

Norm Anchors Make Model Edits Last

Identifies norm-feedback loops causing sequential model edits to fail, proposes norm anchors to stabilize edit composition.

Ax Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang 5/7/2026

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO: distributional flow method for robust LLM post-training via distributional RL, improving OOD generalization with fine-grained value modeling.

Ax Zhaokun Wang, Jinyu Guo, Jingwen Pu, Hongli Pu, Meng Yang, Xunlei Chen, Jie Ou, Wenyi Li, Guangchun Luo, Wenhong Tian 5/7/2026

CAP: Controllable Alignment Prompting for Unlearning in LLMs

CAP: Controllable Alignment Prompting for unlearning sensitive information from LLMs without parameter access, enabling regulatory compliance.

Ax Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan 5/7/2026

AI Alignment via Incentives and Correction

AI Alignment via Incentives and Correction: Framework applying law-and-economics deterrence models to prevent misconduct in agentic AI systems.

Ax Xinwei Shen, Nicolai Meinshausen 5/7/2026

Distributional Principal Autoencoders

Dimension reduction technique learning distributional models matching conditional data distributions for lossless reconstruction.