Ax Connor Douglas, Joel Persson, Foster Provost 5/15/2026

Logging Policy Design for Off-Policy Evaluation

Research on designing logging policies to minimize off-policy evaluation error for treatment policies like recommender systems.

Ax Yi Zhang, Yinda Chen, Che Liu, Zeyuan Ding, Jin Xu, Shilong Zou, Junwei Liao, Jiayu Hu, Xiancong Ren, Xiaopeng Zhang, Yechi Liu, Haoyuan Shi, Zecong Tang, Haosong Sun, Renwen Cui, Kuishu Wu, Wenhai Liu, Yang Xu, Yingji Zhang, Yidong Wang, Senkang Hu, Jinpeng Lu, Nga Teng Chan, Yechen Wu, Yong Dai, Jian Tang, Xiaozhu Ju 5/15/2026

Pelican-Unified 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action

Pelican-Unified 1.0: Embodied foundation model using single VLM for unified understanding, reasoning, imagination, and action in shared semantic space.

Ax Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen 5/15/2026

Self-Distilled Agentic Reinforcement Learning

On-Policy Self-Distillation (OPSD) method for RL-based LLM agents using dense token-level supervision from teacher branch with privileged context for multi-turn interactions.

Ax Ryan Wei Heng Quek, Sanghyuk Lee, Alfred Wei Lun Leong, Arun Verma, Alok Prakash, Nancy F. Chen, Bryan Kian Hsiang Low, Daniela Rus, Armando Solar-Lezama 5/15/2026

MeMo: Memory as a Model

MeMo framework encodes new knowledge into dedicated memory model while keeping LLM frozen, enabling efficient knowledge incorporation for domain-specific applications.

Ax Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Geiping 5/15/2026

FutureSim: Replaying World Events to Evaluate Adaptive Agents

FutureSim grounded simulation replaying real-world events chronologically to evaluate adaptive agents' ability to forecast beyond knowledge cutoff.

Ax Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li 5/15/2026

IPR-1: Interactive Physical Reasoner

Interactive Physical Reasoner agent with G2U benchmark (1000+ games) for learning physics and causality through environment interaction with visual domain gaps.

Ax Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick 5/15/2026

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

Conformal inference approach for adaptive reasoning in LLMs with fixed compute budgets, balancing risk and accuracy through principled token allocation.

Ax Borja Requena, Austin Letson, Krystian Nowakowski, Izan Beltran-Ferreiro, Leopoldo Sarra 5/15/2026

A Minimal Agent for Automated Theorem Proving

Minimal agentic baseline for automated theorem proving implementing iterative refinement, library search, and context management with comparative evaluation.

Ax Yu Luo, Rongchen Gao, Lu Teng, Xidao Wen, Jiamin Jiang, Qingliang Zhang, Yongqian Sun, Shenglin Zhang, Jiasong Feng, Tong Liu, Wenjie Zhang, Dan Pei 5/15/2026

Graph of States: Solving Abductive Tasks with Large Language Models

Graph of States framework for solving abductive reasoning tasks with LLMs, addressing unstructured state representation issues in logical reasoning tasks.

Ax Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim 5/15/2026

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench benchmark for evaluating foundation models as agentic assistants in personalized smart home environments with iteratively built household states.

Ax Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu 5/15/2026

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Workspace-Bench 1.0 benchmark for evaluating AI agents on realistic workspace tasks with complex file dependencies and implicit/explicit relationships.

Ax Jianghan Shen, Siqi Luo, Xinyu Cheng, Jing Xiong, Yue Li, Jiyao Liu, Jiashi Lin, Yirong Chen, Junjun He 5/15/2026

CuSearch: Curriculum Rollout Sampling via Search Depth for Agentic RAG

CuSearch proposes curriculum sampling for training agentic RAG systems via reinforcement learning, optimizing policies based on trajectory search depth rather than uniform sampling.

Ax Kangning Zhang, Shuai Shao, Qingyao Li, Jianghao Lin, Lingyue Fu, Shijian Wang, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu 5/15/2026

MMSkills: Towards Multimodal Skills for General Visual Agents

MMSkills framework for reusable multimodal skills in visual agents, encoding procedural knowledge across visual, textual and executable modalities.

Ax Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song 5/15/2026

Progent: Securing AI Agents with Privilege Control

Progent framework securing AI agents with privilege control against prompt injection attacks through dynamic security requirements and tool access management.