Научное открытие · фев. 2026
OpenAI internal model
First Proof: исследовательские задачи как eval
Во время обучения внутреннюю модель проверили на десяти новых задачах исследовательского уровня. После обратной связи экспертов OpenAI оценила как вероятно верные не менее пяти попыток доказательства.
Это важный, но не чистый автономный тест: люди выбирали лучшие попытки и просили уточнения. Одну первоначально принятую попытку после разбора отозвали как неверную.
Источники
OpenAI · First Proof submissionsОткрыть первоисточник