Новые цены от Alibaba и DeepSeek
Автор: А_З_КAlibaba выпустила Qwen3.8-Max — свою крупнейшую модель с 2,4 трлн параметров. Из них одновременно активны только 95 млрд благодаря архитектуре mixture-of-experts, что снижает задержки и стоимость обработки. Модель поддерживает окно контекста в один миллион токенов, работает с изображениями и текстом и стоит 2 доллара за миллион входных токенов и 6 долларов за выходные. В официальном анонсе Alibaba отдельно отметила успехи модели в задачах для e-commerce и в проектировании микросхем — компания явно целится не только в разработчиков, но и в прикладной бизнес.
DeepSeek ответила моделью меньше — V4-Flash (284 млрд параметров, 13 млрд активны), но с рекордно низкими тарифами: 0,14 доллара за миллион входных токенов и 0,28 доллара за столько же выходных. Для сравнения, Kimi K3 от Moonshot AI, содержащая 2,8 трлн параметров и ставшая одной из крупнейших открытых моделей в мире, обходится в 3 доллара за вход и 15 долларов за выход такого же количества токенов. При этом независимые тесты показывают, что Kimi K3 пока остаётся самым надёжным вариантом «из коробки»: в серии из 45 контролируемых запросов она стабильнее всех выдавала видимый ответ, тогда как и Qwen, и DeepSeek в значительной части попыток «съедали» весь лимит на рассуждения и не возвращали текст вовсе — проблема скорее ориентировании конфигурации бюджета на рассуждение, чем на решение поставленной задачи, и для бизнеса это ощутимый операционный риск.
Почему это важно: цены на инференс падают не только за счёт «железа», но и из-за продуманной архитектуры и конкуренции. Прямые сравнения стоимости выполнения задач показывают разрыв ещё сильнее. По данным исследовательской компании Artificial Analysis, на которые ссылается Reuters, средняя стоимость одного теста у DeepSeek V4-Flash составила всего 3 цента, у Kimi K3 — 86 центов, у GPT-5.6 Sol от OpenAI — 1,86 доллара, у флагманской Claude Fable 5 от Anthropic — 3,15 доллара. Получается, что запуск V4-Flash обходится более чем в сто раз дешевле, чем у Anthropic.
Правда, дешевизна не равна мощности. В рейтинге Intelligence Index, объединяющем девять тестов на программирование, рассуждение и рабочие задачи, DeepSeek V4-Flash набрала 50 баллов из 100 — на уровне Google Gemini 3.6 Flash, но заметно ниже, чем у Kimi K3 (57 баллов) и моделей OpenAI и Anthropic, которые опередили китайскую разработку минимум на девять пунктов. По независимым агентским и кодинговым бенчмаркам DeepSeek-V4-Flash-0731 всё же заметно прибавил по сравнению с предыдущей версией и приблизилась к уровню Claude Opus — это показывает, что «дешёвая» модель не значит «слабая», просто у неё другой набор сильных и слабых сторон.
Главное — не цена за токен, а итоговая стоимость задачи. Модель может генерировать больше текста или требовать больше циклов рассуждения, что кратно увеличивает счёт. Поэтому оценивать модели стоит под конкретную рабочую нагрузку, а не по одним лишь тарифам на токены — и обязательно измерять реальную долю запросов, которые доходят до полезного ответа, а не обрываются на середине рассуждения.
Открытые веса — ещё один способ экономить. Alibaba, DeepSeek и Moonshot AI выкладывают веса моделей в открытый доступ, часто под MIT-лицензией. Разработчики могут развернуть модель на своей инфраструктуре, не платить за API и не зависеть от вендора. Для бизнеса это особенно ценно: можно контролировать данные и предсказуемо считать расходы. DeepSeek, например, опубликовала в открытом доступе предварительную версию V4 ещё в апреле 2026 года — сразу в двух вариантах: флагманскую V4-Pro на 1,6 трлн параметров и экономичную V4-Flash. У Kimi K3 и Qwen3.8-Max ситуация с полным раскрытием весов и техотчётов пока менее прозрачная — часть материалов выходит с задержкой, так что перед тем как строить продукт на открытой модели, стоит свериться с актуальной лицензией у самого разработчика.
Дешёвый рынок долго не продержится. Уже 6 августа стало известно, что DeepSeek готовится «существенно» повысить цены на свои модели, включая V4-Flash. Компания не раскрыла конкретные цифры, пообещав представить детали позже. Как пишет South China Morning Post, решение отражает трудности, с которыми китайский стартап сталкивается, пытаясь удерживать агрессивно низкие цены в условиях жёсткой конкуренции — и это решение рискует подпортить репутацию DeepSeek как самого доступного игрока на рынке. Параллельно компания развивает собственное производство ИИ-чипов, чтобы снизить зависимость от внешних поставщиков процессоров — ещё один способ контролировать себестоимость инференса в будущем, но не факт, что эта стратегия сработает быстро.
Кому полезно: стартапам и компаниям, которые встраивают AI в свои продукты; разработчикам, ищущим баланс между качеством и ценой; всем, кто устал от дорогих подписок и хочет иметь запасной вариант — но готов мириться с тем, что дешёвая модель иногда возвращает пустой ответ вместо решения.
Что можно делать уже сейчас: протестировать DeepSeek V4-Flash, Qwen3.8-Max или Kimi K3 через Hugging Face или API — бенчмарки показывают, что для многих бизнес-задач они «достаточно хороши». Но стоит помнить, что нынешние цены могут оказаться временными, а не новой нормой рынка, а конфигурация лимита на рассуждения способна сильно повлиять на надёжность ответов. Главное — проверять результат человеком, особенно в ответственных сценариях, и не привязываться намертво к одному вендору, если экономика может измениться уже через пару месяцев.
п.с. при использовании через API модели DeepSeek всё ещё сильно дешевле европейских моделей, в том числе наших топовых моделей Яндекс ГПТ и Гигачат, разница существенная — но с учётом анонса о повышении цен этот разрыв может начать сокращаться уже в ближайшие месяцы.