ЛАБОРАТОРИЯ / 2026-09-08

Модели в цифрах

Сравните основные модели на одной задаче. У каждого числа — версия теста, конфигурация и источник.

Модели в сравнении9 / 9

Срез: 2026-09-08. Выбирайте 2–4 модели для наглядного сравнения. «—» — значения нет в этом срезе; часть чисел округлена источником. Учитывайте конфигурацию и дату теста.

Независимый тест

AA Intelligence Index v4.3

10 оценок: работа агентов, код, знания и научное рассуждение. Округлённые баллы; одинаковое число не означает одинаковые способности.

  1. Claude Fable 5.1max + fallback53
Источник и методика
Независимый тест

Terminal-Bench 4.0 · AA

66 задач, три запуска, средний pass@1. Независимый прогон AA: его цифры могут отличаться от таблиц лабораторий.

  1. GPT-6 Astramax59.1%
  2. Claude Fable 5.1max + fallback52%

GLM-5.3

Источник и методика
Независимый тест

AutomationBench-AA · Score

657 закрытых задач, v1.0.6. Доля выполненных целей с частичным зачётом; нарушение ограничений обнуляет задачу. Это не доля полностью завершённых работ.

  1. GPT-6 Astramax68.5%
  2. Grok 4.6high66.7%
  3. GLM-5.3max62.2%

Claude Fable 5.1 · GPT-5.6 Sol

Источник и методика
Таблица лаборатории

DeepSWE v1.1 · release table

Длинные инженерные задачи. Сравнительная таблица OpenAI; максимум по опубликованным уровням reasoning, а не одинаковая цена вычислений.

  1. GPT-6 Astraмаксимум в таблице релиза74.1%
  2. Gemini 3.8 Flashмаксимум в таблице релиза73.8%
  3. GPT-5.6 Solмаксимум в таблице релиза72.7%
  4. Claude Fable 5.1максимум в таблице релиза67.4%

GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3

Источник и методика
Таблица лаборатории

GPQA Diamond

Вопросы по естественным наукам. Данные сравнительной таблицы OpenAI; высокий балл не доказывает способность делать открытия.

  1. GPT-6 Astraмаксимум в таблице релиза96%
  2. Gemini 3.8 Flashмаксимум в таблице релиза95.3%
  3. GPT-5.6 Solмаксимум в таблице релиза94.6%
  4. Claude Fable 5.1максимум в таблице релиза93.7%

GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3

Источник и методика
Таблица лаборатории

FrontierMath Tier 4 · v2

Самый сложный уровень FrontierMath. Не сопоставляется с Tier 1–3; настройки приведены в источнике.

  1. GPT-6 Astraмаксимум в таблице релиза97.6%
  2. Claude Fable 5.1максимум в таблице релиза87.8%
  3. GPT-5.6 Solмаксимум в таблице релиза83%

Gemini 3.8 Flash · GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3

Источник и методика
Одинаковый балл — разные сильные стороны

Индекс v4.3 обновлён 7 сентября. Его нельзя сравнивать с июльскими числами v4.1. Чтобы выбрать рабочую модель, начните со своей задачи.

Подобрать модель