На линию
Способности на главной линии · ПОСТОБУЧЕНИЕ

Следование намерению человека

СутьВ 2022 году модели научились заметно лучше понимать просьбы человека и отвечать в формате диалога. Для этого их дообучали на примерах инструкций и оценках людей.

ChatGPT превратил языковую модель из исследовательского инструмента в массовый интерфейс. Главными ограничениями остались уверенные ошибки и склонность соглашаться с пользователем.

СтатусПРОЙДЕНО
ТипСпособности на главной линии
Отметка2022
Событий в досье7
Хронология развития

Исследовано

2022-03

InstructGPT

О событииВыравнивание по инструкциям — модель начала слушаться.

подтвержденоОтдельная страница

InstructGPT соединила обучение на примерах инструкций с предпочтениями людей и показала, что меньшая, но дообученная модель может быть полезнее более крупной базовой. Это сместило центр разработки от одного предобучения к постобучению: формату ответа, отказам, стилю и соответствию намерению пользователя.

Источник: arXiv
2022-11

ChatGPT

О событииДиалоговый интерфейс сделал следование инструкциям массовым способом работы с языковой моделью.

подтвержденоОтдельная страница
Источник: OpenAI
2023-03

GPT-4

О событииРезультаты человеческого уровня на профессиональных экзаменах вывели ИИ из категории игрушек.

подтвержденоОтдельная страница
Источник: OpenAI
2024-03

Claude 3

О событииСемейство Anthropic закрепило полноценную конкуренцию нескольких frontier-лабораторий в рассуждении, коде и анализе изображений.

подтвержденоОтдельная страница
Источник: Anthropic

В процессе

сейчас

Угодливость как дефект

О событииМодель, обученная нравиться, склонна соглашаться. Отучить её поддакивать — открытая задача выравнивания.

В планах

впереди

Обучение на обратной связи от дела

О событииЗаменить оценку «понравился ли ответ» на оценку «сработал ли результат в реальности».

Источники и исследования

Первоисточники, на которых основано досье: научные публикации, материалы лабораторий и официальные отчёты.

Направления
Способности на главной линии