Ax Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li 5/5/2026

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

Segment-Aligned Policy Optimization (SAPO) for LLM reinforcement learning that aligns credit assignment with reasoning step structure in multi-modal tasks.

Ax Alexander Smola 5/5/2026

Submodular Benchmark Selection

Multimodal ML framework for pneumonia screening combining symptoms, respiratory patterns, and imaging.

Ax Yiheng Zhang, Kaiyan Zhao, Shaowu Wu, Yiming Wang, Jiajun Wu, Leong Hou U, Steve Drew, Xiaoguang Niu 5/5/2026

Anon: Extrapolating Optimizer Adaptivity Across the Real Spectrum

Anon optimizer improves adaptive methods like Adam by adjusting pre-conditioner adaptivity to generalize better across diverse optimization landscapes.

Ax Yiheng Zhang, Yiming Wang, Kaiyan Zhao, Zhenglin Wan, Jiayu Chen, Leong Hou U 5/5/2026

ANO: A Principled Approach to Robust Policy Optimization

ANO framework unifies PPO and SPO by establishing trust region approach that balances gradient information retention with optimization stability in deep RL.

Ax Kyle Zheng, Han Zhang, Renliang Sun, Chenchen Ye, Wei Wang 5/5/2026

FitText: Evolving Agent Tool Ecologies via Memetic Retrieval

FitText framework enables dynamic tool retrieval in AI agent reasoning loops by embedding retrieval directly in execution, addressing semantic gaps between task descriptions and API documentation.