Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation
Sep 24, 2026·
,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,,·
0 min read
Lin Shi
Haowei Lin
Zixuan Zhu
Xiaoyue Zhou
Xiang Li
Xiangning Lin
Yaxuan Deng
Han Xu
Yuangang Li
Shanda Li
Zizhao Chen
Hanwen Xing
Harsh Raj
Bo Chen
Quan Shi
Steven Dillmann
Yipeng Gao
Puneesh Khanna
Ruofan Lu
Chao Beyond Zhou
Michael Yang
Robert Zhang
Siyuan Chai
Jiayu Chang
Yizhao Chen
Xiaokun Chen
Yiwei Dai
Wenting Yang
Hange Liu
Minghao Liu
Zihan Wang
Adnan El Assadi
Benedikt Stroebl
E. Kelly Buchanan
Han Meng
Junwei He
Longxuan Yu
Radin Shayanfar
Yukyung Lee
Zhikang Dong
Allen G Hart
Anjiang Wei
Anurag Kashyap
Arpandeep Khatua
Audrey Jixin Zheng
Chengrui Ma
David Heineman
Dubing Chen
Hai-Anh Trinh
Haishuo Fang
Hefan Zhang
Hui Shen
Issa Sugiura
Jiankai Sun
Jiechao Gao
Junhong Lin
Junnan Li
Kai Yang
Lei Hsiung
Maoyu Wang
Mengze Tang
Nabil Omi
Negin Raoof
Nicholas Edwards
Octavia Guo
Orfeas Menis Mastromichalakis
Pengliang Ji
Przemysław Hejman
Qi Qi
Qunshu Lin
Richard Zhuang
Rui Yang
Ruichen Zheng
Ryan Marten
Shaghayegh Fazliani
Shizheng Hou
Sicong Jiang
Sijie Li
Boqin Yuan
Michael Glass
Song Bian
Terry Yue Zhuo
Tianqing Wu
Tom Tang
Wanjia Zhao
Weihao Xuan
Wenhua Liang
Xian Liu
Xin Lan
Xuan Zhang
Xuandong Zhao
Yanchuan Tang
Yifan Jiang
Yijiang Li
Yitong Guan
Yizhi Li
Yonghui Liu
Yuheng Tang
Yujun (Audrey) Mao
Yunfei Zhao
Yuxin Wang
Yuxuan Tang
Zhenheng Tang
Zhifei Li
Ziruo Wang
Ziyu She
Kaiyuan Liu
Iheb Chaabane
Yuxin Tang
Xiangyi Li
Satya Sai Srinath Namburi GNVV
Xinyue Zheng
Andy Konwinski
Boxuan Li
Leon Liangyu Chen
Alex Dimakis
Nicholas Carlini
Soroush Vosoughi
Sanmi Koyejo
Di He
Etash Guha
Benjamin Feuer
Mike Merrill
Ludwig Schmidt
Alex Shaw
Abstract
Evaluating agents on the growing number of agentic benchmarks is challenging because they often require complex environments and agent integrations. We introduce Harbor Adapters, a unified evaluation infrastructure for agentic benchmarks. Our work makes three contributions. First, we develop benchmark adapters that port more than 80 benchmarks to evaluate arbitrary agents, and validate them through rigorous code review and parity experiments. Second, we conduct a large-scale evaluation of 8 models spanning capability tiers across 54 benchmarks; every model is run with Terminus-2 and with one of 3 native harnesses. This enables a broader analysis of agent capabilities and failure modes than was previously possible. Third, we introduce Harbor-Index, a curated set of 82 difficult, diverse, and high-quality tasks spanning 29 benchmarks, refined from the adapted suite through difficulty filtering, AI and human audit, and an audit-and-fix loop. Harbor-Index preserves the challenge and breadth of large-scale agentic evaluations while being affordable to run; no evaluated model-harness configuration exceeds 30% pass rate, and the strongest (GPT-5.5 with Codex) reaches 28.0%. We release the adapters, evaluation results, in-depth analysis, and Harbor-Index as open-source artifacts to support more reliable and comprehensive evaluation of language-model agents.
Type
Publication
NeurIPS 2026 (E&D)