Ax Richard B. Arthur 4/23/2026

A Field Guide to Decision Making

arXiv paper on decision-making frameworks augmented by machine intelligence for high-consequence scenarios.

Ax Young Min Cho, Daniele Bonadiman, Divya Bhargavi, Tamer Alkhouli, Salvatore Romeo, Dongwei Jiang, Khushbu Pahwa, Yubin Ge, Etsuko Ishii, Monica Sunkara, Yi Zhang 4/23/2026

Supplement Generation Training for Enhancing Agentic Task Performance

Training method for adapting smaller LLMs to agentic tasks by generating supplemental text without retraining large models.

Ax Zihan Chen, Song Wang, Zhen Tan, Xingbo Fu, Zhenyu Lei, Peng Wang, Huan Liu, Cong Shen, Jundong Li 4/23/2026

A Survey of Scaling in Large Language Model Reasoning

Survey examining scaling strategies for LLM reasoning including multi-agent collaboration and impact on model performance.

Ax Tianqing Fang, Zhisong Zhang, Xiaoyang Wang, Rui Wang, Can Qin, Yuxuan Wan, Jun-Yu Ma, Ce Zhang, Jiaqi Chen, Xiyun Li, Yonglin Wang, Jingchen Ni, Tianshi Zheng, Chun Chen, Wenhao Yu, Zhenwen Liang, Hongming Zhang, Haitao Mi, Dong Yu 4/23/2026

Cognitive Kernel-Pro: A Framework for Deep Research Agents and Agent Foundation Models Training

Open-source framework for building general AI agents with deep research and autonomous capabilities without relying on proprietary APIs.

Ax Jonathan Bragg, Mike D'Arcy, Nishant Balepur, Dan Bareket, Bhavana Dalvi, Sergey Feldman, Dany Haddad, Jena D. Hwang, Peter Jansen, Varsha Kishore, Bodhisattwa Prasad Majumder, Aakanksha Naik, Sigal Rahamimov, Kyle Richardson, Amanpreet Singh, Harshit Surana, Aryeh Tiktinsky, Rosni Vasu, Guy Wiener, Chloe Anastasiades, Stefan Candra, Jason Dunkelberger, Dan Emery, Rob Evans, Malachi Hamada, Regan Huff, Rodney Kinney, Matt Latzke, Jaron Lochner, Ruben Lozano-Aguilera, Cecile Nguyen, Smita Rao, Amber Tanaka, Brooke Vlahos, Peter Clark, Doug Downey, Yoav Goldberg, Ashish Sabharwal, Daniel S. Weld 4/23/2026

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

AstaBench provides rigorous benchmarking suite for evaluating AI agents on scientific research tasks including literature review, experiments, and data analysis.

Ax Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou, Jiwei Wei, Yang Yang 4/23/2026

Lightweight LLM Agent Memory with Small Language Models

Proposes lightweight external memory system for LLM agents using small language models, reducing overhead while maintaining accuracy for cross-turn consistency in long-horizon tasks.

Ax Magda Dubois, Ekin Zorer, Maia Hamin, Joe Skinner, Alexandra Souly, Jerome Wynne, Harry Coppock, Lucas Sato, Sayash Kapoor, Sunishchal Dev, Keno Juchems, Kimberly Mai, Timo Flesch, Lennart Luettgau, Charles Teague, Eric Patey, JJ Allaire, Lorenzo Pacchiardi, Jose Hernandez-Orallo, Cozmin Ududec 4/23/2026

Seven simple steps for log analysis in AI systems

Proposes standardized pipeline for log analysis in AI systems with Python code examples, establishing best practices for understanding model capabilities and evaluation integrity.

Ax Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li 4/23/2026

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX automates LLM fine-tuning via multi-agent tree-based exploration, orchestrating researcher and executor agents to handle requirement analysis, experimentation, and optimization.

Ax Debodeep Banerjee, Burcu Sayin, Stefano Teso, Andrea Passerini 4/23/2026

Hybrid Decision Making via Conformal VLM-generated Guidance

Applies conformal prediction to VLM-generated guidance in hybrid decision-making, ensuring reliable human-AI collaboration where AI provides guidance rather than decisions.

Ax Nikhil Verma, InJung Yang, Sungil Kim, KoKeun Kim, YoungJoon Kim, Manasa Bharadwaj, Yolanda Liu, Kevin Ferreira 4/23/2026

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench evaluates foundation models as agentic assistants in personalized smart home environments through iterative benchmark construction with rich household states.

Ax Suhaib Abdurahman, Etsuko Ishii, Katerina Margatina, Divya Bhargavi, Monica Sunkara, Yi Zhang 4/23/2026

Explicit Trait Inference for Multi-Agent Coordination

Explicit Trait Inference improves LLM-based multi-agent coordination by tracking partner warmth and competence characteristics.

Ax Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu 4/23/2026

Fairness Testing of Large Language Models in Role-Playing

Studies fairness and bias in LLMs during role-playing scenarios, assessing whether social biases emerge in simulated roles.