Вехи на линии · МЫШЛЕНИЕ

Рассуждение

Раньше модель выпаливала ответ сразу. Теперь ей дают подумать: она разбирает задачу по шагам, проверяет себя и тратит на сложное больше времени — как человек, который взял черновик.

Модель научили тратить вычисления в момент ответа: думать дольше — значит решать сложнее. Появилась вторая ось масштабирования помимо обучения.

СтатусПРОЙДЕНО
ТипВехи на линии
Отметка2024
Что уже есть7

Исследовано

2022

Цепочка рассуждений

Просьба «рассуждай пошагово» подняла точность — первый намёк на то, что думать во время ответа выгодно.

подтверждено
2024

o1

Цепочка рассуждений как продукт, а не трюк промпта.

подтверждено
2025

Путь к золоту олимпиады

AlphaProof взял серебро IMO 2024, Aristotle — золотой уровень 2025 года. Все системы, решавшие задачи формально, работали через Lean.

подтвержденоNature
2026-07

AxiomProver: 42 из 42

Ансамбль агентов закрыл все шесть задач Международной олимпиады по математике 2026 года формальными доказательствами на Lean 4.

НОВОЕпо сообщениямGitHub

В процессе

сейчас

Рассуждение плюс инструменты

Размышление и вызов калькулятора, поиска или кода слились в один цикл вместо двух отдельных режимов.

НОВОЕ

В планах

в планах

Знать, когда думать

Долгое рассуждение стоит дорого. Модель должна сама решать, где нужен черновик, а где хватит рефлекса.

НОВОЕ

Дальние перспективы

впереди

Рассуждение длиной в месяцы

Задачи, где размышление и проверка занимают недели непрерывной работы, а не минуты.

НОВОЕ
Ответвления
Вехи на линии
На линию

Следить за движением линии

Раз в неделю — какие ветви продвинулись, что открылось и что оказалось преувеличением.