Написал комментарий к посту Пятница! О чем поговорим вечером?
В свете текущего состояния на пути изучения ИИ могу сказать, что проблема начинается со словаря.
Для обработки естественного языка текст режут на кусочки по нескольку букв, с целью получить набор, которым эффективнее всего получится сжать текст. Перечень этих кусочков, вида "кря", "ее_", "прог" называют "словарь". Затем этим элементам словаря ставят в соответствие длинные наборы случайных чисел. После этого начинают обучение, суть которого в том, чтобы научить предсказывать наиболее актуальный токен для предыдущей последовательности. Другими словами, изменяют положение, изначально случайное, каждого вектора всего словаря в многомерном пространстве так, чтобы рядом с одним элементом находились другие наиболее часто встречающиеся.
Когда в обученную модель отгружают настоящий запрос, то программа точно также режет его на токены, после чего отгружает в модель вектора из словаря. Далее, упрощённо, модель складывает вектора в длинный и на его основе результата продолжает текст из наиболее близких в пространстве. На самом деле вектора не просто складывают, а сначала пересчитывают на основе словаря и контекста, но здесь пока процесс не понял до уровня "на пальцах".
Фабула изложенного выше в том, что в пространстве происходит моделирование взаимодействия не представлений об объектах и их свойств, а бессмысленных сочетаний букв. Тем удивительнее, что актуальные нейросети выдают тексты, которые позволяют продуктивно поразмышлять.
Теперь про шутки юмора. Шутка хороша ровно тем, что отличает шум от музыки: формирование последовательности, которая в головном мозге вызывает ошибку предсказания. Типа, если было "ля-ля-ля", то мозг ожидает следующим будет "ля", а получает "бум" в композиции - ошибка предсказания. Затем насколько раз "ля-ля-ля-бум", предсказанное корректно, вызывает вознаграждение от дофаминовой системы. Очень похожий процесс в юморе: "идёт лысый по пустыне, вдруг из-за угла круглого дома рука! Хвать лысого за волосы и об лёд, и об лёд, и об лёд". Предсказание сначала одно, а потом ломается. Шутка ещё смешнее, когда есть несколько вариантов прогнозов с ходом развития описания событий, а шутка вызывает необходимость пересчёта описания с наиболее вероятного, предсказанного, на менее вероятный. Чем длиннее шутка - тем круче. С точки зрения вычислительных мощностей.
Для получения шутки необходимо выполнить гораздо больше операций в нейросети. Надо получить две ветки многомерного пространства, идентичные в начале, но совершенно разные по итогу, при завершении. Если для одной ветки длиной N, надо выполнить N^2 вычислений, то для поиска юмора надо перебрать всё, а это N^N сложность. На существующем железе, если заморочится, наверное можно будет получать около одной шутки, длиной в один абзац, в сутки. А если ещё и контекст повествования важен (роман, рассказ), то и за месяц может быть одну получить удастся. 300 мегаватт-часов на шутку - многовато, однако.
Написал комментарий к посту Пятница! О чем поговорим вечером?
Nerd dictation + VOSK. Пробовал это сочетание полгода назад. Работает локально, ресурсов особо не требует, то есть работает нормально и на центральном процессоре. Выяснил, что распознает нормально, но больших текстов за домашним компьютером не набираю.