Генеративные модели не появляются из воздуха: чтобы научиться писать связный текст, они прочитывают миллиарды чужих страниц. Среди этих страниц — книги, статьи и посты, которые кто-то написал, рассчитывая на оплату или хотя бы на упоминание. Вопрос, кто и сколько должен платить авторам за такое обучение, перестал быть теоретическим. Я считаю, что бесплатное использование чужих текстов для тренировки коммерческих моделей несправедливо, и попробую объяснить почему, не сводя всё к лозунгам.

Что показывают настроения авторов

Опросы внутри писательского сообщества дают довольно однозначную картину. Около 90% авторов считают, что им должны платить за использование их произведений в обучении ИИ, а примерно две трети поддерживают идею коллективного лицензирования — единой системы, которая собирала бы отчисления и распределяла их между правообладателями. Это не каприз: значительная доля авторов прямо говорит, что видит в генеративных моделях угрозу своей профессии.

Можно спорить, преувеличена ли эта тревога. Но факт остаётся фактом: люди, чей труд стал сырьём, в массе своей не давали на это осознанного согласия и не получили за это ничего.

Аргумент про обучение как чтение

Самое популярное возражение звучит так: модель просто учится на текстах, как учится человек, который много читает. Мы же не платим писателю каждый раз, когда кто-то прочитал его книгу и стал лучше формулировать мысли.

Аналогия красивая, но хромает в важном месте. Человек читает в ограниченных масштабах и не воспроизводит прочитанное промышленно. Коммерческая модель копирует тексты целиком на этапе подготовки данных, хранит их и используется потом для извлечения прибыли в объёмах, недоступных ни одному читателю. Разница не в природе процесса, а в масштабе и в коммерческой цели.

Юридическая реальность уже сдвигается

Это не абстрактные рассуждения. В 2025 году одна из крупных ИИ-компаний согласилась на крупную выплату по иску авторов и издателей после того, как суд установил, что она незаконно скачивала и хранила защищённые авторским правом книги. Сам факт такого урегулирования — сигнал: подход сначала возьмём, потом разберёмся начинает дорого обходиться.

Параллельно крупные издательства вводят правила, обязывающие авторов раскрывать использование ИИ при подаче рукописей. То есть индустрия уже признаёт, что граница между человеческим и машинным трудом важна и её надо как-то фиксировать.