Terminal-Bench-Science — бенчмарк научных ИИ-агентов
Terminal-Bench-Science 0.1 — агентный бенчмарк, в котором модель работает в реальном терминале и решает задачи из области научных исследований. Согласно анонсу Anthropic, флагман Claude Mythos 5.1 набрал 52.6% — более чем вдвое превысив результат предшественника.

Что такое Terminal-Bench-Science
Terminal-Bench-Science отличается от классических тестов на знания: агент не отвечает на вопросы, а выполняет многошаговые научные задания в терминале — пишет код, запускает эксперименты, анализирует данные и интерпретирует результаты. Публичный лидерборд считает по 3 попытки на задачу в harness Claude Code; воспроизведение Anthropic даёт несколько иные цифры — расхождение укладывается в пределы шума (±3.5–4.5 пп на модель).
Результаты моделей
| Модель | Anthropic (воспроизведение) | Публичный лидерборд |
|---|---|---|
| Fable 5.1 / Mythos 5.1 | 52.6% | — |
| Opus 5 | 29.0% | 30.0% |
| Fable 5 | 24.7% | 21.4% |
| GPT-5.6 Sol | 22.4% | — |
Прирост к Fable 5 — более чем двукратный: 52.6% против 24.7%. Такой скачок между поколениями редко встречается в агентных бенчмарках.
Мы обнаружили, что Claude Fable 5.1 способна обучить нейронную сеть и построить карту высот трети поверхности Венеры по радарным снимкам миссии NASA Magellan.
Anthropic System Card — Fable 5.1 / Mythos 5.1
Контекст: другие бенчмарки Mythos 5.1
Terminal-Bench-Science — один из нескольких агентных тестов той же модели:
| Бенчмарк | Mythos 5.1 |
|---|---|
| Terminal-Bench-Science 0.1 | 52.6% |
| Terminal-Bench 4.0 (кодирование) | 60.9% |
| CursorBench 3.2.0 | 73.4% |
| Humanity’s Last Exam (с инструментами) | 65.0% |
| OSWorld 2.0 (strict / partial) | 41.7% / 77.9% |
| AutomationBench | 31.4% |
| GDPval-AA v2 | 1853 |
Разрыв между научным (52.6%) и кодовым (60.9%) бенчмарками объясняется природой задач: научные задания требуют не только кода, но и доменных знаний в физике, биологии, химии.
Смежная верификационная программа Cyber Verification Program оценивает применение тех же научных способностей в условиях повышенных требований к безопасности.
Как читать результаты
Пять правил для корректной интерпретации:
- Сравнивайте только одну версию бенчмарка — TBS 0.1 несопоставим с будущими версиями.
- Учитывайте ошибку ±4.5 пп: разница менее 5 пунктов между моделями может быть шумом.
- Различайте harness: публичный лидерборд и воспроизведение Anthropic — разные методологии.
- Если ваш кейс — биоинформатика или численные методы, TBS ближе к реальности, чем бенчмарки на кодирование.
- Актуальные данные — на странице Claude Mythos; лидерборд обновляется с выходом новых моделей.
Responsible Scaling Policy Anthropic определяет, при каких пороговых значениях таких бенчмарков модель требует дополнительной оценки безопасности перед выпуском.
