Terminal-Bench: бенчмарк для ИИ-агентов в терминале — версии и результаты моделей
Terminal-Bench — открытый бенчмарк для оценки ИИ-моделей на реальных задачах в командной строке: отладке кода, работе с файловой системой и многошаговых агентных сценариях. Методология опубликована в официальном репозитории на GitHub. Claude Fable 5.1 набирает на этом тесте 55,8% — лучший результат среди моделей общего назначения.

Что измеряет Terminal-Bench
Ключевая идея — проверять не знания, а способность действовать. Агент получает задачу в реальной Linux-среде: инструменты, терминал, объективный критерий успеха. Задача засчитана только при проверяемом результате — запустился ли скрипт, прошли ли тесты.
Бенчмарк охватывает:
- отладку и исправление кода в реальных репозиториях
- многошаговые сценарии с несколькими инструментами
- написание и запуск тестов с автоверификацией
- взаимодействие с внешними API и сервисами
Полный список поддерживаемых моделей и их идентификаторов — в обзоре моделей Anthropic.
Terminal-Bench 4.0: таблица результатов
Четвёртая версия — основной инструмент оценки агентного программирования с длинными цепочками инструментов и проверкой на устойчивость к ошибкам.
| Модель | Terminal-Bench 4.0 |
|---|---|
| Claude Mythos 5.1 | 60,9% |
| Claude Fable 5.1 | 55,8% |
| Opus 5 | 52,3% |
| Claude Fable 5 | 42,0% |
| GPT-5.6 Sol | 37,3% |
Прирост Fable 5.1 к предшественнику — 13,8 п.п. Официальные результаты опубликованы в анонсе Claude Fable 5.1.
Агентные бенчмарки на реальных задачах — единственный объективный способ сравнивать модели для инженерных сценариев.
Anthropic, документация по tool use
Terminal-Bench-Science 0.1: наука и вычисления
Научная версия — задачи по анализу данных, символьной математике и биоинформатике. Claude Fable 5.1 набирает 52,6%, тогда как Fable 5 остановился на 24,7% — рост почти вдвое.
| Модель | Terminal-Bench-Science 0.1 |
|---|---|
| Claude Fable 5.1 | 52,6% |
| Claude Fable 5 | 24,7% |
Если вас интересует, как эффорт-тиры влияют на качество агентных задач, читайте о системе управления усилиями модели.
Как выбирать модель по данным Terminal-Bench
Terminal-Bench — не единственный агентный тест: OSWorld 2.0 проверяет управление GUI (Fable 5.1 — 77,9%/41,7%), CursorBench 3.2.0 — IDE-ассистенты (73,4%), GDPval-AA v2 — аналитику (1853 балла). Вот практические советы:
- Смотрите на абсолютный процент, а не только на ранг: разница 55%→60% в продакшне — десятки лишних итераций в неделю.
- Science-версию проверяйте отдельно — она релевантна лишь при задачах с научными вычислениями.
- Уточняйте, при каком режиме усилий получен результат: CursorBench —
effort=max, это влияет на стоимость. - Дополняйте Terminal-Bench данными из OSWorld 2.0, если задача включает GUI или браузер.
Модель доступна на AWS Bedrock, Google Cloud и Azure. Стоимость агентных прогонов сильно зависит от кэша — подробнее в статье о кэшировании промптов в Claude.
