Если в двух словах: как ChatGPT генерирует изображения сегодня — он рисует их сам, той же моделью, что пишет текст, а не отправляет запрос отдельному «художнику» DALL-E, как было раньше. Картинка собирается тем же мозгом, который понимает твою фразу, — без передачи между двумя разными системами. Это и объясняет, почему результат вдруг стал так хорошо понимать сложные просьбы и держать текст на изображении.

Разберём это по-честному, без магии. А поскольку без подписки Plus картинок много не нарисуешь, сразу отмечу бытовое: оплатить ChatGPT Plus российской картой напрямую не выйдет. Теперь к самому интересному — как эта картинка вообще рождается.

Короткий ответ: ChatGPT рисует сам, без DALL-E

Раньше схема была двухступенчатой: ты писал запрос ChatGPT, он переформулировал его и отправлял отдельной модели DALL-E, а та рисовала. Два разных механизма, между ними — передача задания, и на этой передаче терялись нюансы.

С весны 2025 года всё иначе. Генерация изображений встроена прямо в языковую модель: тот же ИИ, что понимает контекст разговора, сам и рисует. Нет посредника, нет «испорченного телефона» между пониманием и картинкой. Именно поэтому модель стала понимать просьбы вроде «нарисуй схему и подпиши стрелки по-русски» — она не пересказывает задачу чужой системе, а держит её целиком. Раньше на этой передаче терялась половина смысла: ChatGPT понимал запрос, но DALL-E получал уже сжатую формулировку и рисовал что-то приблизительное. Теперь понимание и рисование — один процесс, и разрыва, на котором раньше ломались детали, попросту нет. Практический эффект слияния замечаешь сразу: можно вести диалог о картинке в том же чате, где обсуждал идею. Скажешь «нарисуй по мотивам того, что мы придумали» — и модель учтёт контекст всей переписки, а не только последнюю фразу-промпт. Для DALL-E это было невозможно в принципе: он видел лишь то, что ему передали одной строкой.

Картинка по кусочкам

Как ChatGPT генерирует изображения: что происходит под капотом — фото 1

Вот тут самое любопытное. DALL-E 3 работал на диффузии: грубо говоря, брал «шум» и постепенно проявлял из него картинку целиком, как проявляют фотографию. Новый подход другой — модель генерирует изображение авторегрессионно, по кусочкам, примерно так же, как пишет текст слово за словом.

Что это значит на практике? Модель обучалась на совместном «языке» картинок и текста — она понимает не только как изображение связано со словами, но и как его части связаны между собой. Отсюда и «визуальная грамотность»: композиция получается осмысленной, а подписи внутри картинки — читаемыми, потому что для модели буква на изображении — это почти то же, что буква в тексте. Диффузионные модели как раз на тексте внутри картинки традиционно плыли, и это была их вечная боль. Грубая аналогия: диффузия — это как вылепить всю фигуру разом из тумана и потом надеяться, что надпись на ней сложится сама; авторегрессия — как выписывать картинку последовательно, контролируя каждый следующий фрагмент по уже нарисованному. Второй способ куда предсказуемее там, где важны порядок и структура, — в тексте, таблицах, схемах.