AIКитайKimi K3Moonshot AIopen sourceMCPB2Bстоимость AILLM бенчмарки
🤖

Китай open-source побил GPT за треть цены:
что такое Kimi K3 и что с этим делать

· 18 мин чтения · Aleks Ota

Коротко: Kimi K3 — 2.8-триллионная open-source модель от китайской Moonshot AI. Вышла 16 июля 2026. Занимает 2-е место в мире по AA-Briefcase (бизнес-задачи: K3=1,548 vs GPT-5.6 Sol=1,495, Fable 5=1,583). 3-е место по GDPval-AA (K3=1,668 vs Fable 5=1,760). BrowseComp: 91.2/100 — лучший результат в мире для задач веб-исследования. Цена API: $3 вход / $15 выход за миллион токенов — против $10/$50 у Fable 5. Команда, тратящая $5,000/мес на Fable 5, сэкономит $42,000 в год при переходе. Открытые веса выходят 27 июля 2026 по Modified MIT лицензии. Попробовать прямо сейчас — на kimi.com, без карты.

2,8 трлн
параметров Kimi K3
Moonshot AI
2-е место
AA-Briefcase бизнес-бенчмарк
K3=1,548 vs Fable 5=1,583
91.2/100
BrowseComp лучший в мире
Artificial Analysis
$3/$15
цена K3 (in/out)
за миллион токенов
$42,000
экономия в год
при $5k/мес на Fable 5
27 июля
открытые веса
Modified MIT

1. Что произошло: крупнейший open-source момент после DeepSeek

Январь 2025-го. DeepSeek R1 вышел за $0.14 за миллион токенов — в 70 раз дешевле GPT-4o. Рынок сначала не поверил. Потом за 48 часов переоценил весь AI-сектор.

Июль 2026-го. Moonshot AI — китайская лаборатория, которую на Западе почти никто не знает — выпустила крупнейшую open-source модель в истории: 2.8 трлн параметров. Она обгоняет GPT-5.6 Sol на ключевом бизнес-бенчмарке. Стоит $3 за миллион входящих токенов. Fable 5 стоит $10 за то же самое. Разница — в 3.3 раза.

16 июля 2026 года Moonshot AI выпустила Kimi K3. Технические параметры подтверждены восемью независимыми источниками — не пресс-релизами лаборатории, а внешними ревью.

Архитектура. 2.8 трлн параметров, Mixture-of-Experts (MoE). Модель разбита на 896 специализированных экспертных сетей — но на каждый токен активируется только 16 из них. Именно поэтому при 2.8T параметрах API стоит $3 за миллион — а не $30.

Контекстное окно. 1,048,576 токенов — ровно один миллион. На практике: весь документ, вся переписка, средняя кодовая база — в один промпт. Без чанкинга, без потери контекста между частями.

Мультимодальность. Native vision: модель обрабатывает изображения напрямую, без внешнего адаптера. Видео ни один независимый источник не подтверждает — только изображения.

Стратегия выхода. API работает прямо сейчас по $3/$15. Полные открытые веса — 27 июля, Modified MIT. Восемь дней между запуском API и открытием весов — не случайность: Moonshot собирает API-выручку на пике хайпа, потом открывает модель для экосистемы.

Сообщество назвало это сразу: "DeepSeek 2.0 moment". VentureBeat разобрал технические детали, Matthias Bastian в The Decoder написал про конец эпохи дешёвого китайского AI.

2. Почему это смена парадигмы, а не очередная новость

Паттерн января 2025-го повторяется. Западные лаборатории доказывают, что их модели стоят в 3-5 раз дороже из-за проприетарных данных, RLHF-инвестиций и enterprise-надёжности. Затем китайская лаборатория выпускает что-то, что на бенчмарках почти не отличается — и стоит втрое дешевле, с открытыми весами.

Это не история об одной модели, которая обошла другую. Это история о том, что стоимость frontier-инференса структурно падает. DeepSeek доказал это первый раз. Kimi K3 подтверждает: тренд системный, не разовый.

Для тех, кто строит на AI — то есть для тебя — вывод практический: твоя стоимость AI-инфраструктуры из первого квартала 2026 уже устарела. Модель, которая делает твой продукт возможным, сейчас в 3 раза дешевле, чем три месяца назад. А с 27 июля её можно хостить самостоятельно.

Честный caveat, который нужно сказать здесь: Kimi K3 — новая модель. Независимые тестировщики фиксируют day-one баги и отмечают, что процент галлюцинаций выше, чем у предыдущей версии K2.6. Бенчмарк-скоры показывают, на что модель способна в контролируемых условиях. Продакшн-поведение зависит от твоего конкретного кейса, промптинга и требований к надёжности.

3. Новая архитектура простыми словами: как работает 2.8T MoE?

"2.8 трлн параметров" — звучит как маркетинг. Вот что это реально означает для пайплайна.

Плотная (dense) модель вроде старого GPT-4 активирует каждый параметр на каждом токене. 1 трлн параметров — 1 трлн операций на токен, каждый раз, без исключений. Дорого.

Kimi K3 — Mixture-of-Experts. 2.8T параметров распределены по 896 экспертным сетям. Перед каждым токеном работает маленькая роутерная модель: она смотрит на токен и решает, какие 16 из 896 экспертов наиболее релевантны именно сейчас. Остальные 880 не делают ничего.

Результат: ты получаешь знания 2.8T модели (все эксперты обучались на разных частях данных), но платишь только за вычисления 16/896 от этой мощности. Роутер добавляет небольшой overhead, но суммарные затраты на инференс несравнимо ниже, чем у плотной 2.8T модели.

Вот откуда $3 за миллион токенов. Это не демпинг — это архитектурное преимущество. Контекстное окно в 1 млн токенов работает вместе с MoE: целый документ идёт в один вызов, без чанкинга и без потери качества из-за потери контекста между чанками.

4. Мой кейс Content Factory — реальные цифры

Я строю Content Factory — AI-пайплайн, который производит контент для 15+ платформ из одного новостного брифа. Сейчас как основная модель для финального generation-шага используется Fable 5.

Я беру Kimi K3 серьёзно не из-за числа параметров. Из-за одного конкретного скора: BrowseComp 91.2/100.

BrowseComp измеряет способность модели навигировать и синтезировать информацию из веб-контента. Именно это делает мой агент верификации брифов: берёт сырую новостную тему, ищет по 12+ источникам, сверяет утверждения, производит верифицированный фактический бриф. BrowseComp 91.2 — лучший результат в мире, ни одна модель сейчас не выше по этой задаче.

Текущий setup: верификация брифов работает на Fable 5. Месячный cost только на этот шаг — примерно $400. Если K3 сопоставим по качеству — а BrowseComp даёт основания думать, что он может быть сопоставим — этот шаг будет стоить около $120/мес. Экономия $280/мес только на одном узле.

На этой неделе я провожу прямое сравнение: K3 против Fable 5 на шаге верификации. Одни и те же сырые источники, одна и та же задача. Результат опубликую честно — включая если K3 хуже.

Контекстное окно в 1 млн токенов здесь тоже важно. Сейчас я режу документы на чанки потому что модель не вмещает. Нативный 1М-контекст убирает всю эту логику и потерю качества от чанкинга.

5. Экономика — что заинтересует CFO

Цифры ниже верифицированы по независимым источникам. Цена Fable 5 подтверждена apidog.com, cloudzero.com и ещё тремя источниками. Цена K3 — verdent.ai и четырьмя дополнительными.

Сравнение цен (за миллион токенов)

Модель Входящие Исходящие Контекст Открытые веса
Kimi K3 $3.00 $15.00 1М токенов 27 июля 2026
Fable 5 Max $10.00 $50.00 Нет
GPT-5.6 Sol Max переменная переменная Нет
DeepSeek V4 $0.27 $1.10 128K Да

Математика для B2B-команды с $5,000/мес расходов на Fable 5 API: текущий расход $5,000/мес — та же нагрузка на K3 при 3.3x разнице в цене ~$1,500/мес — ежемесячная экономия $3,500 — годовая экономия $42,000 — эквивалент одного Middle-разработчика.

$42,000 в год — вот цифра для CFO-презентации. Не "мы сменили AI-модель", а "мы сократили расходы на AI-инфраструктуру на $42,000 при сохранении качества на ключевых задачах."

Открытые веса добавляют второй аргумент для finance-команды: data residency и vendor lock-in. Каждый вызов к закрытому API отправляет твои данные на чужой сервер в чужой юрисдикции. Когда 27 июля выйдут полные веса, модель можно развернуть на своей инфраструктуре — Contabo, AWS, собственный GPU-кластер — и все данные инференса остаются внутри твоего контура.

Сравнение качества (данные Artificial Analysis)

Модель AA-Briefcase (бизнес) GDPval-AA v2 (общий) BrowseComp
Fable 5 Max 1,583 (#1) 1,760 (#1)
Kimi K3 1,548 (#2) 1,668 (#3) 91.2 (#1)
GPT-5.6 Sol Max 1,495 (#3) 1,748 (#2)

6. Что умирает, что живёт

Умирает
Обоснование платить 3x за закрытую модель на commodity-задачах
Аргумент 'не можем использовать open-source — данные уходят'
Нарратив 'китайский AI всегда хуже'
Живёт
Enterprise SLA, uptime-гарантии закрытых моделей
Инфраструктура файн-тюнинга для специфических задач
Необходимость тестировать модель на своей нагрузке

7. Что делать на следующей неделе

Соло-строитель или маленькая команда Зайди на kimi.com прямо сейчас. Без карты, без очереди. Прогони через K3 свой самый дорогостоящий регулярный промпт и сравни вывод с тем, что у тебя сейчас. Потрать 30 минут. Если качество в пределах допустимого — возьми API-ключ на platform.kimi.com и прогони тест на 1,000 вызовов с реальной нагрузкой.
CTO или технический руководитель B2B Начни разговор с compliance-командой сегодня, до 27 июля. Выясни требования к data residency. Когда веса выйдут 27 июля по Modified MIT — тебе нужно знать заранее: может ли организация хостить self-deployed модель и что требует юридический ревью-процесс.
Оцениваешь AI-инструменты как покупатель Попроси своего текущего AI-вендора показать сравнение цен и бенчмарков с K3. Если внятного ответа нет — это информация. Рынок меняется достаточно быстро, что вендоры, которые не отслеживают open-source альтернативы, уже отстают.

8. Раскладка B2C / B2B

Соло-фаундерам и DIY-строителям

Kimi K3 — наиболее практичная open-source frontier-модель для соло-разработчиков и малых команд прямо сейчас. Цена $3/М токенов работает на микромасштабе: 1 млн токенов = $3. Пайплайн на 10 млн токенов в месяц обходится в $30-150 в зависимости от соотношения input/output. Сравни с той же нагрузкой на Fable 5 — $100-500/мес.

Сначала попробуй бесплатно на kimi.com. BrowseComp 91.2 релевантен конкретно для автоматизации ресёрча, контент-пайплайнов, которые читают веб-источники, и любых агентов, которые навигируют документы. Здесь K3 не просто конкурентен — он лучший в мире.

B2B-командам

Стратегический вопрос не "стоит ли попробовать K3" — ответ да, и на этой неделе. Вопрос: "какой у нас фреймворк оценки для решения, какие Fable 5 задачи переводить?"

Сделай оценку в три колонки: (1) задачи, где качество измеримо эквивалентно, (2) задачи, где есть заметный gap, (3) задачи, заблокированные compliance до 27 июля. Направляй усилия по переключению в первую колонку. Используй $42,000/год как аргумент для топ-менеджмента, чтобы обосновать время на оценку.

Для соло-строителей

AI Model Cost Calculator — таблица по 6 моделям

Google Sheet с K3, Fable 5, GPT-5.6 Sol, Gemini 2.5, DeepSeek V4 и Llama 4 Scout — вбиваешь свои токены в месяц и сразу видишь разницу в долларах с бенчмарк-скорами рядом. Напиши «шаблон» боту @N8N270426_bot — пришлю напрямую.

Открыть @N8N270426_bot → слово шаблон
Для B2B-команд

Бесплатный 20-минутный AI Stack Audit

Если твоя компания тратит $2,000+/мес на AI API — разберём текущее использование моделей, посчитаем потенциальную экономию на K3 и определим, какие нагрузки можно переключить без потери качества. Напиши «аудит» в @N8N270426_bot или ответь на этот пост.

Открыть @N8N270426_bot → слово аудит

Часто задаваемые вопросы

Kimi K3 лучше Fable 5?

Нет, в целом. Kimi K3 стоит на 2-м месте по AA-Briefcase (бизнес-задачи: K3=1,548 vs Fable 5=1,583) и на 3-м по GDPval-AA (K3=1,668 vs Fable 5=1,760). Fable 5 стабильно впереди. K3 обгоняет GPT-5.6 Sol по AA-Briefcase (1,548 vs 1,495) и держит лучший BrowseComp в мире: 91.2/100. Правильное сравнение для большинства команд — K3 против их текущей модели, а не K3 против абсолютного фронтира.

Когда точно выходят открытые веса?

Moonshot AI обязался выпустить полные 2.8T веса до 27 июля 2026 года под Modified MIT лицензией. По состоянию на 17 июля веса ещё не опубликованы. Modified MIT разрешает коммерческое использование, модификацию и self-hosting с требованием attribution. Следи за обновлениями на kimi.com или в официальных каналах Moonshot AI.

Можно ли использовать K3 в enterprise?

Да, через API на platform.kimi.com уже сегодня. Для on-premises деплоя с гарантиями data residency — жди 27 июля. Modified MIT позволяет коммерческое развертывание. Enterprise SLA — отдельный вопрос к Moonshot AI.

Что такое BrowseComp и почему 91.2 важно?

BrowseComp — бенчмарк, измеряющий способность модели находить, читать и синтезировать информацию из веб-контента и документов. 91.2/100 означает, что K3 правильно ответил на 91.2% вопросов веб-ресёрча в контролируемых условиях. Это лучший опубликованный результат — ни одна другая модель не выше. Релевантно, если твои AI-задачи включают чтение документов, ресёрч из множества источников или агентов, которые навигируют веб.

Насколько K3 безопасно использовать прямо сейчас?

Модель работает и доступна. Независимые тестировщики зафиксировали day-one баги и отметили, что процент галлюцинаций выше, чем у K2.6 — предыдущей версии Kimi. Для продакшна: прогони свою нагрузку через тестовую выборку перед запуском на полную мощность. Бенчмарк-скоры показывают возможности в идеальных условиях — продакшн-надёжность требует твоей собственной проверки.

Какая реальная разница в стоимости?

Входящие: $3/М токенов (K3) vs $10/М (Fable 5) — разница в 3.3 раза. Исходящие: $15/М (K3) vs $50/М (Fable 5) — разница в 3.3 раза. При $5,000/мес расходов на Fable 5 эквивалентная нагрузка на K3 стоит ~$1,500/мес. Годовая экономия: $42,000. Цифры предполагают сопоставимое качество для твоих конкретных задач — верифицируй сначала своими тестами.