AA Intelligence Index v4.3
10 оценок: работа агентов, код, знания и научное рассуждение. Округлённые баллы; одинаковое число не означает одинаковые способности.
Источник и методикаСравните основные модели на одной задаче. У каждого числа — версия теста, конфигурация и источник.
Срез: 2026-09-08. Выбирайте 2–4 модели для наглядного сравнения. «—» — значения нет в этом срезе; часть чисел округлена источником. Учитывайте конфигурацию и дату теста.
10 оценок: работа агентов, код, знания и научное рассуждение. Округлённые баллы; одинаковое число не означает одинаковые способности.
Источник и методика66 задач, три запуска, средний pass@1. Независимый прогон AA: его цифры могут отличаться от таблиц лабораторий.
— GLM-5.3
Источник и методика657 закрытых задач, v1.0.6. Доля выполненных целей с частичным зачётом; нарушение ограничений обнуляет задачу. Это не доля полностью завершённых работ.
— Claude Fable 5.1 · GPT-5.6 Sol
Источник и методикаДлинные инженерные задачи. Сравнительная таблица OpenAI; максимум по опубликованным уровням reasoning, а не одинаковая цена вычислений.
— GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3
Источник и методикаВопросы по естественным наукам. Данные сравнительной таблицы OpenAI; высокий балл не доказывает способность делать открытия.
— GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3
Источник и методикаСамый сложный уровень FrontierMath. Не сопоставляется с Tier 1–3; настройки приведены в источнике.
— Gemini 3.8 Flash · GLM-5.3 · DeepSeek V4 Pro 0813 · Grok 4.6 · Muse Spark 1.3 · Kimi K3
Источник и методикаИндекс v4.3 обновлён 7 сентября. Его нельзя сравнивать с июльскими числами v4.1. Чтобы выбрать рабочую модель, начните со своей задачи.
Подобрать модель →