Вехи на линии · ЧУВСТВА

Мультимодальность

Одной и той же модели теперь можно показать картинку, дать послушать запись или включить видео — и она поймёт всё это вместе, а не по отдельности.

Одна модель принимает текст, картинку, звук и видео и отвечает в реальном времени. Компьютер получил органы чувств вместо поля ввода.

СтатусПРОЙДЕНО
ТипВехи на линии
Отметка2024
Что уже есть6

Исследовано

2021

CLIP

Общее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.

подтверждено
2022

Whisper

Распознавание речи дошло до уровня, при котором звук стал обычным входом, а не отдельной задачей.

подтверждено
2023

GPT-4V

Зрение как штатная часть большой модели.

подтверждено
2024

Realtime-голос

Задержка диалога упала до человеческой.

подтверждено

В процессе

сейчас

Понимание длинного видео

Час записи модель уже принимает, но следить за сюжетом и причинами внутри него ещё не умеет.

НОВОЕ

Дальние перспективы

впереди

Осязание и запах

Модальности, для которых пока нет ни дешёвых датчиков, ни больших наборов данных.

НОВОЕ
Ответвления
Вехи на линии
На линию

Следить за движением линии

Раз в неделю — какие ветви продвинулись, что открылось и что оказалось преувеличением.