CLIP обучалась сопоставлять изображения с текстовыми описаниями из интернета и тем самым поместила две модальности в общее пространство признаков. Это позволило задавать визуальные категории словами без отдельной разметки под каждую задачу и стало важной опорой для последующих генеративных и мультимодальных систем.
Источник: OpenAICLIP
О событииОбщее пространство для текста и изображений — фундамент, на котором выросла вся генерация картинок.