Terminal-Bench-Science — бенчмарк научных ИИ-агентов

Terminal-Bench-Science 0.1 — агентный бенчмарк, в котором модель работает в реальном терминале и решает задачи из области научных исследований. Согласно анонсу Anthropic, флагман Claude Mythos 5.1 набрал 52.6% — более чем вдвое превысив результат предшественника.

Научный ИИ-агент работает в терминале с научными данными — Terminal-Bench-Science бенчмарк
Terminal-Bench-Science: агент в терминале решает научные задачи — от анализа данных до астрономических расчётов

Что такое Terminal-Bench-Science

Terminal-Bench-Science отличается от классических тестов на знания: агент не отвечает на вопросы, а выполняет многошаговые научные задания в терминале — пишет код, запускает эксперименты, анализирует данные и интерпретирует результаты. Публичный лидерборд считает по 3 попытки на задачу в harness Claude Code; воспроизведение Anthropic даёт несколько иные цифры — расхождение укладывается в пределы шума (±3.5–4.5 пп на модель).

Результаты моделей

МодельAnthropic (воспроизведение)Публичный лидерборд
Fable 5.1 / Mythos 5.152.6%
Opus 529.0%30.0%
Fable 524.7%21.4%
GPT-5.6 Sol22.4%

Прирост к Fable 5 — более чем двукратный: 52.6% против 24.7%. Такой скачок между поколениями редко встречается в агентных бенчмарках.

Мы обнаружили, что Claude Fable 5.1 способна обучить нейронную сеть и построить карту высот трети поверхности Венеры по радарным снимкам миссии NASA Magellan.

Anthropic System Card — Fable 5.1 / Mythos 5.1

Контекст: другие бенчмарки Mythos 5.1

Terminal-Bench-Science — один из нескольких агентных тестов той же модели:

БенчмаркMythos 5.1
Terminal-Bench-Science 0.152.6%
Terminal-Bench 4.0 (кодирование)60.9%
CursorBench 3.2.073.4%
Humanity’s Last Exam (с инструментами)65.0%
OSWorld 2.0 (strict / partial)41.7% / 77.9%
AutomationBench31.4%
GDPval-AA v21853

Разрыв между научным (52.6%) и кодовым (60.9%) бенчмарками объясняется природой задач: научные задания требуют не только кода, но и доменных знаний в физике, биологии, химии.

Смежная верификационная программа Cyber Verification Program оценивает применение тех же научных способностей в условиях повышенных требований к безопасности.

Как читать результаты

Пять правил для корректной интерпретации:

  1. Сравнивайте только одну версию бенчмарка — TBS 0.1 несопоставим с будущими версиями.
  2. Учитывайте ошибку ±4.5 пп: разница менее 5 пунктов между моделями может быть шумом.
  3. Различайте harness: публичный лидерборд и воспроизведение Anthropic — разные методологии.
  4. Если ваш кейс — биоинформатика или численные методы, TBS ближе к реальности, чем бенчмарки на кодирование.
  5. Актуальные данные — на странице Claude Mythos; лидерборд обновляется с выходом новых моделей.

Responsible Scaling Policy Anthropic определяет, при каких пороговых значениях таких бенчмарков модель требует дополнительной оценки безопасности перед выпуском.

FAQ

keyboard_arrow_up