Ax Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal 4/7/2026

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO method aligns diffusion models with multiple conflicting evaluation metrics for text-to-image generation.

Ax Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide 4/7/2026

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI uses Vision-Language Models embedded in autonomous driving stack for reasoning-based trajectory planning under partial observability.

Ax Gordana Ispirova, Michael Sebek, Giulia Menichetti 4/7/2026

Informatics for Food Processing

Chapter reviewing ML/AI applications in food processing, covering classification frameworks and data science approaches to food informatics.

Ax Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran 4/7/2026

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench evaluates LLM safety alignment across six scientific domains with sophisticated, knowledge-intensive adversarial prompts.

Ax Patrick Vossler, Fan Xia, Yifan Mai, Adarsh Subbaswamy, Jean Feng 4/7/2026

LLMs Judging LLMs: A Simplex Perspective

Framework for evaluating LLM judges of LLM outputs, accounting for both sampling and judge quality uncertainty without gold-standard scores.

Ax Yifu Yuan, Haiqin Cui, Yaoting Huang, Yibin Chen, Fei Ni, Zibin Dong, Pengyi Li, Yan Zheng, Hongyao Tang, Jianye Hao 4/7/2026

Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation

Embodied-R1 introduces a 3B VLM using "pointing" as unified intermediate representation to address the seeing-to-doing gap in robotic manipulation across different embodiments.

Ax Vincent Grari, Tim Arni, Thibault Laugel, Sylvain Lamprier, James Zou, Marcin Detyniecki 4/7/2026

ACT: Agentic Classification Tree

ACT system combines decision trees with LLMs to provide transparent, interpretable, and auditable AI decisions on unstructured data.

Ax Shaofeng Yin, Jiaxin Ge, Zora Zhiruo Wang, Chenyang Wang, Xiuyu Li, Michael J. Black, Trevor Darrell, Angjoo Kanazawa, Haiwen Feng 4/7/2026

Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning

Vision-language agent framework combining inverse graphics with interleaved multimodal reasoning for reconstructing images into editable programs with spatial grounding.

Ax Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva 4/7/2026

Self-Improving Pretraining: using post-trained models to pretrain better models

Method improving language model pretraining by using post-trained models as data sources to instill desired behaviors like safety and reasoning earlier in training.

Ax Chanhyuk Lee, Jaehoon Yoo, Manan Agarwal, Sheel Shah, Jerry Huang, Aditi Raghunathan, Seunghoon Hong, Nicholas M. Boffi, Jinwoo Kim 4/7/2026

Flow Map Language Models: One-step Language Modeling via Continuous Denoising

Language model based on continuous flows over token embeddings demonstrating faster generation than discrete diffusion and autoregressive models with improved few-step quality.