Цепочка рассуждений
Просьба «рассуждай пошагово» подняла точность — первый намёк на то, что думать во время ответа выгодно.
Раньше модель выпаливала ответ сразу. Теперь ей дают подумать: она разбирает задачу по шагам, проверяет себя и тратит на сложное больше времени — как человек, который взял черновик.
Модель научили тратить вычисления в момент ответа: думать дольше — значит решать сложнее. Появилась вторая ось масштабирования помимо обучения.
Просьба «рассуждай пошагово» подняла точность — первый намёк на то, что думать во время ответа выгодно.
Цепочка рассуждений как продукт, а не трюк промпта.
AlphaProof взял серебро IMO 2024, Aristotle — золотой уровень 2025 года. Все системы, решавшие задачи формально, работали через Lean.
Ансамбль агентов закрыл все шесть задач Международной олимпиады по математике 2026 года формальными доказательствами на Lean 4.
Размышление и вызов калькулятора, поиска или кода слились в один цикл вместо двух отдельных режимов.
Долгое рассуждение стоит дорого. Модель должна сама решать, где нужен черновик, а где хватит рефлекса.
Задачи, где размышление и проверка занимают недели непрерывной работы, а не минуты.