Terminal-Bench: бенчмарк для ИИ-агентов в терминале — версии и результаты моделей

Terminal-Bench — открытый бенчмарк для оценки ИИ-моделей на реальных задачах в командной строке: отладке кода, работе с файловой системой и многошаговых агентных сценариях. Методология опубликована в официальном репозитории на GitHub. Claude Fable 5.1 набирает на этом тесте 55,8% — лучший результат среди моделей общего назначения.

Terminal-Bench бенчмарк для ИИ-моделей — результаты и сравнение
Сравнение результатов топовых ИИ-моделей на Terminal-Bench 4.0

Что измеряет Terminal-Bench

Ключевая идея — проверять не знания, а способность действовать. Агент получает задачу в реальной Linux-среде: инструменты, терминал, объективный критерий успеха. Задача засчитана только при проверяемом результате — запустился ли скрипт, прошли ли тесты.

Бенчмарк охватывает:

  • отладку и исправление кода в реальных репозиториях
  • многошаговые сценарии с несколькими инструментами
  • написание и запуск тестов с автоверификацией
  • взаимодействие с внешними API и сервисами

Полный список поддерживаемых моделей и их идентификаторов — в обзоре моделей Anthropic.

Terminal-Bench 4.0: таблица результатов

Четвёртая версия — основной инструмент оценки агентного программирования с длинными цепочками инструментов и проверкой на устойчивость к ошибкам.

МодельTerminal-Bench 4.0
Claude Mythos 5.160,9%
Claude Fable 5.155,8%
Opus 552,3%
Claude Fable 542,0%
GPT-5.6 Sol37,3%

Прирост Fable 5.1 к предшественнику — 13,8 п.п. Официальные результаты опубликованы в анонсе Claude Fable 5.1.

Агентные бенчмарки на реальных задачах — единственный объективный способ сравнивать модели для инженерных сценариев.

Anthropic, документация по tool use

Terminal-Bench-Science 0.1: наука и вычисления

Научная версия — задачи по анализу данных, символьной математике и биоинформатике. Claude Fable 5.1 набирает 52,6%, тогда как Fable 5 остановился на 24,7% — рост почти вдвое.

МодельTerminal-Bench-Science 0.1
Claude Fable 5.152,6%
Claude Fable 524,7%

Если вас интересует, как эффорт-тиры влияют на качество агентных задач, читайте о системе управления усилиями модели.

Как выбирать модель по данным Terminal-Bench

Terminal-Bench — не единственный агентный тест: OSWorld 2.0 проверяет управление GUI (Fable 5.1 — 77,9%/41,7%), CursorBench 3.2.0 — IDE-ассистенты (73,4%), GDPval-AA v2 — аналитику (1853 балла). Вот практические советы:

  1. Смотрите на абсолютный процент, а не только на ранг: разница 55%→60% в продакшне — десятки лишних итераций в неделю.
  2. Science-версию проверяйте отдельно — она релевантна лишь при задачах с научными вычислениями.
  3. Уточняйте, при каком режиме усилий получен результат: CursorBench — effort=max, это влияет на стоимость.
  4. Дополняйте Terminal-Bench данными из OSWorld 2.0, если задача включает GUI или браузер.

Модель доступна на AWS Bedrock, Google Cloud и Azure. Стоимость агентных прогонов сильно зависит от кэша — подробнее в статье о кэшировании промптов в Claude.

FAQ

keyboard_arrow_up