Написал(-a) комментарий к посту Как я обмишулился с нейронкой
Василий, в сетературе полно вторичных текстов, вдохновлённых ровно тем же, на чём LLM обучали и рассчитывали веса. Многие первоисточники написаны далеко не 15–20 лет назад. Вы будете смеяться, но в мировой литературе вообще всего четыре сюжета (по Борхесу). Книг при этом — сотни миллионов, и каждый год добавляются новые миллионы глубоко вторичного чтива. Но авторы фанфиков и графоманы — всё-таки люди. Они пытаются переосмыслить реальность и создать хоть какие-то новые смыслы. ИИ смыслы не создаёт в принципе. Количество прочитанного Вами здесь ни при чем — можно прочесть горы книг, но так и не заметить разницы между компиляцией букв и живым текстом.
У меня нет мнения о писателях — ни хорошего, ни плохого. Есть физика процесса. То, что человек порой не может сформулировать идею, пока она не воплотилась в текст, не значит, что он, подобно алгоритму, выстраивает цепочку слов по вероятностному принципу. Интуитивное знание тем и отличается от аналитического, что оно еще не обрело словесную форму. У творческих людей логика часто уступает интуиции — в чём беда-то? Писатель в процессе реализует сюжет, который умом до конца не осознаёт, но он чувствует его и, главное, помнит то, что написал главой ранее. А модель не «помнит» — она лишь математически удерживает контекст. Ваши аргументы не имеют отношения ни к теории литературы, ни к архитектуре нейросетей.
Про токены Вы тоже заблуждаетесь. Токены отменить нельзя, как нельзя отменить пиксели на мониторе. Это базовые элементы, по которым модель считает веса и выдает ответ. Так что токены будут всегда. Генерировать целые книги теоретически станет возможно, когда контекстное окно растянут миллионов до пяти знаков. Сейчас у Gemini контекст позволяет анализировать приличный объем печатных знаков (полмиллиона в русском тексте точно), но глобально это ничего не меняет: вероятностный принцип генерации «слово за словом» всё равно не позволит LLM увидеть и осмыслить произведение в целом, до того как будет поставлена последняя точка.
Законы появятся, но в них важно другое: ни один генеративный текст в мире не является объектом авторского права и таковым не будет. Юридическую ценность и маркировку получит именно «мясной», человеческий текст. А что будет с машинной штамповкой — литературе фиолетово. Единственное, для чего действительно нужны LLM — это анализ готового материала. Как литературовед, критик или бета-ридер модель справится отлично. По крайней мере, лучше, чем человек, не имеющий базовых знаний в области теории литературы
Написал(-a) комментарий к посту Дайджест всякого N290: Искусство создания аннотации
Для разных платформ продающие хвосты разные. Там прицел на аудиторию. В промпте нужно прямо прописывать это. В частности, интеллектуальная аудитория инстинктивно плюётся, если какой-то перец пытается развести на слабо или сподвигнуть к чтению на эффекте стада. В общем, всё там настраивается, и алгоритмом лучше, чем вручную. Проверяла. Работает. Поэтому не трогаю.