Ну чё, малютки, редкий случай: open-weight модель отстаёт от закрытого фронтира на реальном бенчмарке всего на 1.6 пункта. Не «почти догнала на маркетинговом слайде» — 1.6 пункта на честном SWE-bench Verified, который каждый может перепроверить сам. Обычно вопрос к таким релизам: «что там нового внутри». В этот раз интереснее другой: как вообще эксплуатировать 2.8 триллиона параметров и не проиграть по скорости лабам с бесконечным бюджетом на инференс.
Встречайте Kimi K3 от Moonshot AI. Предыдущая модель этой линейки — Kimi K2.5 — тоже разбирал отдельно, и там главный сюжет был про дистрибуцию и агентский рой. В этот раз сюжет — архитектурный: как устроена экономика инференса модели такого размера.
16 июля 2026 — Moonshot AI анонсирует Kimi K3 на WAIC в Шанхае, модель сразу доступна через API. 27 июля — выкладывают полные веса: 2.8T параметров всего, 104B активных, 896 экспертов (16 роутизируемых + 2 shared на токен), контекст 1M токенов. SWE-bench Verified показывает 93.40%, в 1.6 пункта от Claude Fable 5 (95.00%). Внутри работает Kimi Delta Attention (KDA): гибрид линейного и полного внимания 3:1, который в пейпере Kimi Linear обещал до 6× ускорения декодинга на 1M-контексте — правда, для модели куда меньшего размера.
Часть 1: Что внутри Kimi K3
Голые цифры сначала. Всего в модели 2.8 триллиона параметров, но на каждый токен активируется только 104 миллиарда — MoE в чистом виде. Экспертов у роутера 896, из них на токен включаются 16 плюс 2 постоянно активных shared-эксперта — это меньше 1.8% от общего пула роутизируемых экспертов на один проход. Даже по меркам 2026 года это экстремальная разреженность. Саму механику роутинга и top-k выбора я подробно разбирал в статье про MoE. Здесь не буду повторяться, просто фиксирую новую точку данных: вот насколько разреженной оказалась конфигурация в проде.
Плюс 2 always-on shared-эксперта. Итого на токен работает ≈1.8% роутизируемых экспертов — экстремальная разреженность даже для MoE-флагмана 2026 года.
Полный миллион токенов контекста «из коробки». Reasoning включён всегда — три уровня усилия: low / high / max, а не тумблер «думать или нет».
Зрение здесь нативное, не приклеенный сбоку энкодер: под капотом MoonViT-V2 на 401M параметров. По независимым Vision Evals от Roboflow модель берёт в среднем 66.5% на шести визуальных задачах (15-е место из 23), но на OCR это одна из сильнейших моделей теста: 93.0%, 4-е место из 23. Таймлайн релиза плотный: 16 июля — анонс и доступ через API, 27 июля — полные веса в открытом доступе (порядка 1.5 ТБ на диске, если качать всё разом).
Kimi K2 и K2.5 шли под «Modified MIT» — фактически permissive-лицензией. K3 переходит на новую, авторскую «Kimi K3 License»: это реальный сдвиг условий, не косметика. Если строишь MaaS-бизнес (продаёшь доступ к инференсу или файнтюну третьим лицам) и он зарабатывает больше $20M за 12 месяцев — нужен отдельный договор с Moonshot. А если продукт разрастается больше 100M MAU, то обязательно отображение атрибуции «Kimi K3» в интерфейсе. Локальный запуск и файнтюн для своих нужд — без ограничений.
Доступ — с первого дня. API самого Moonshot заработал ещё 16 июля по цене $3 за 1M входных токенов и $15 за 1M выходных — столько же просят сторонние провайдеры на OpenRouter (семь штук на день релиза, у всех те же ставки).
Запуск: vLLM, SGLang и что для этого реально нужно
День-0 поддержка есть и в vLLM, и в SGLang, но обе явно рассчитаны не на домашний стенд. Минимальное железо, которое называет сам Moonshot, — одна нода 8×B300 (или GB300 NVL72). Меньше не встанет: даже с MXFP4/MXFP8-квантованием, родным для K3 (см. Часть 2), модель просто не влезает.
vLLM:
vllm serve moonshotai/Kimi-K3 \
--tensor-parallel-size 8 \
--trust-remote-code \
--load-format fastsafetensors \
--enable-prefix-caching \
--enable-auto-tool-choice \
--tool-call-parser kimi_k3 \
--reasoning-parser kimi_k3
На GB300 NVL72 в конфигурации TP8 это даёт 111 токенов/с на пользователя (батч 1, без спекулятивного декодинга), TP16 — 118 токенов/с. Со спекулятивным декодингом DSpark (добавляется флагом --speculative-config с моделью Inferact/Kimi-K3-DSpark) цифры вырастают почти в 3 раза: 331 ток/с на TP8 и 370 ток/с на TP16.
SGLang идёт похожим путём — точные флаги живут в официальном cookbook, из общедоступного упоминается --enable-unified-memory — и на связке из 8 GB300 даёт сопоставимые 113 ток/с без спекуляции и ≈423 ток/с с DSpark. Это цифры на одного пользователя; в дисагрегированной конфигурации (prefill отдельно от decode) агрегированная пропускная способность кластера доходит до 2800+ токенов/с на GPU — но это уже метрика для прод-serving под нагрузкой, а не то, что почувствует один клиент.
Если восьми B300 под рукой нет, остаётся локальный путь через кванты. Unsloth уже выкатил динамические GGUF: UD-Q8_K_XL (1.6 ТБ) заявлен как «по-настоящему безлоссовый», UD-2bit — 880 ГБ, UD-IQ1_S — уже около 650 ГБ ценой части качества. Правило простое: суммы RAM и VRAM должно хватать примерно на размер кванта, иначе включается offloading и всё резко замедляется. Запуск — обычный llama.cpp:
./llama.cpp/llama-cli \
--model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
--mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
--temp 1.0 --top-p 0.95
650 гигабайт всё равно не влезут ни в одну домашнюю видеокарту — но это уже не восемь дата-центровых ускорителей, а условный сервер с достаточным объёмом RAM, пусть и медленно.
Бенчмарки — где K3 в ряду фронтира
93.40% против 95.00% у Claude Fable 5 — закрытый фронтир и открытые веса оказались в 1.6 пункта друг от друга на реальном бенчмарке, не на маркетинговом слайде. При этом K3 уже обходит прошлый топ Anthropic, Claude Opus 4.8 (88.60%), и уступает только GPT-5.6 Sol (96.20%).
SWE-bench — только одна точка на карте. По сводному Intelligence Index от Artificial Analysis, который усредняет добрый десяток бенчмарков, у K3 третье место (57 баллов) — позади Fable 5 и GPT-5.6 Sol, но вровень с Claude Opus 4.8. На отдельных срезах K3 даже обгоняет Opus 4.8: в GDPval-AA v2 — 1668 против 1600 Elo.
95.00% − 93.40% = 1.6 пункта. Дистанция между открытыми весами и самой мощной моделью Anthropic на момент выхода K3 — на честном SWE-bench Verified, без урезанных сетапов.
Специально не в сравнении: Qwen3.8-Max-Preview и DeepSeek V4. Не потому что забыл — потому что у обеих на момент написания нет чистых, независимо подтверждённых цифр по этому бенчмарку. У Alibaba для Qwen3.8-Max-Preview до сих пор не опубликован ни model card, ни таблица бенчмарков — только доступ через API и заявление «уступает только Fable 5» без методологии. У DeepSeek V4 цифры по SWE-bench расходятся между вторичными источниками — единого подтверждённого числа нет. Это честный пробел в сравнении, а не недосмотр.
Часть 2: Kimi Delta Attention
Тот же тезис «decode упирается в память» уже звучал в статьях про KV-кэш и FlashAttention. FlashAttention атаковал вопрос как память читается — IO-aware тайлинг, без изменения того, что вообще хранится в KV-кэше. Kimi Delta Attention (KDA) заходит с другой стороны: атакует вопрос сколько вообще нужно хранить, заменяя большую часть слоёв внимания на вариант линейного внимания с состоянием фиксированного размера — вместо растущего с каждым токеном KV-кэша.
Механика (терминология — из самого пейпера Kimi Linear): KDA расширяет Gated DeltaNet более тонким гейтингом, чтобы эффективнее использовать конечную RNN-память состояния. Поверх работает специальный chunkwise-алгоритм над частным случаем Diagonal-Plus-Low-Rank (DPLR) переходных матриц, заточенный под эффективность на железе. По официальному README репозитория, слоёв всего 93: 69 KDA и 24 Gated MLA (полное внимание) — реальное соотношение чуть точнее заявленных «3:1», это 2.9 линейных слоя на один полный. Основную массу вычислений тащит дешёвое линейное внимание, а каждый четвёртый слой держит полное внимание — там, где линейному варианту одному не хватает моделирующей мощности.
Отдельно, вторым и отдельно опубликованным механизмом, в K3 используется Attention Residuals (arXiv 2603.15031, тоже Kimi Team): вместо стандартного накопления residual-связей с фиксированными весами — softmax-внимание поверх выходов предыдущих слоёв. Решает проблему «размытого вклада» слоёв в очень глубоких сетях, когда обычный residual-механизм плохо различает, какой из полусотни предыдущих слоёв реально что-то привнёс. K3 использует масштабируемый вариант этого механизма — Block AttnRes.
И вот тут — важная оговорка. Цифры до 6× ускорения декодинга и до 75% экономии KV-кэша на 1M-контексте — из пейпера Kimi Linear, и относятся они к исследовательской модели 48B total / 3B active, не к продакшен K3. Kimi K3 использует тот же механизм KDA, но уже на масштабе 2.8T/104B — и ни в одном первоисточнике Moonshot эти множители отдельно для K3 не переподтверждены. Механизм тот же, а вот 6×/75% — унаследованная формулировка из пейпера про модель другого размера, а не независимо измеренный результат для самого K3. Это не значит, что для K3 эффект отсутствует — просто утверждать конкретное число некорректно, пока Moonshot не опубликует отдельные цифры.
И ещё одна честная поправка — уже не про цифры, а про саму идею. Гибрид линейного и полного внимания — не изобретение Kimi. Qwen3-Next (Alibaba, сентябрь 2025) уже гонял точно такое же соотношение 3:1: Gated DeltaNet на трёх слоях из четырёх, полное внимание на четвёртом. MiniMax-Text-01 (январь 2025, 456B параметров) сделал это ещё раньше, просто с другим шагом — один слой softmax-внимания на каждые семь Lightning Attention. Даже сам механизм KDA — более тонкий, по-канальный гейтинг вместо по-голового у Gated DeltaNet — описан ещё в пейпере Kimi Linear, до K3. Настоящая новизна K3 не в архитектуре гибрида как таковой, а в том, что её вообще довели до продакшена на 2.8 триллиона параметров: до сих пор никто не показывал, что этот класс архитектур держится на фронтир-масштабе.
Но есть и повод для настороженности. У MiniMax гибрид на небольшом масштабе шёл вровень с полным вниманием на стандартных бенчмарках (MMLU, BBH, MATH, LongBench) — а на большем масштабе всплыл явный провал именно на сложных multi-hop reasoning-задачах, где нужно последовательно опираться на несколько разнесённых по контексту фактов. Кончилось тем, что MiniMax откатила следующую модель, M2, обратно на полное внимание по всем слоям. Прямых доказательств, что K3 наступает на те же грабли, нет — но и доказательств обратного тоже: заявленные 6×/75% для K3 никто отдельно не переподтвердил (см. выше), а независимых замеров качества K3 именно на длинных multi-hop-цепочках пока не публиковали.
Про LatentMoE, впрочем, неопределённости больше нет: и README репозитория, и собственный техотчёт Moonshot по K3 (arXiv:2607.24653, «Kimi K3: Open Frontier Intelligence») прямо называют этот компонент — Stable LatentMoE, сжатие MoE-роутинга по аналогии с тем, как MLA сжимает attention. Тот же техотчёт заявляет ~2.5× улучшение эффективности скейлинга по сравнению с K2.5 — K3 логично продолжает тренд: MoE → LatentMoE, обычное внимание → Gated MLA и KDA, всё в сторону дешёвого инференса без потери качества. Из более мелких деталей: активация здесь SiTU-GLU, а веса и активации обучались сразу в MXFP4/MXFP8 как часть тренировки (quantization-aware training), а не квантуются постфактум. По независимым разборам архитектуры (сама Moonshot это отдельно не расписывает) не обошлось и без апгрейда оптимизатора: MuonClip из K2 (Muon + QK-Clip против взрыва attention-логитов) в K3 превращается в Per-Head Muon — тот же принцип, но применяется к каждой attention-голове по отдельности.
Часть 3: Приём — цифры и споры
Реакция на релиз оказалась быстрой и двойственной.
Сначала цифры. На Hugging Face K3 за первые 30 минут после выкладки весов 27 июля набрал больше 4000 лайков и вышел в топ трендов — CEO платформы Клеман Деланг назвал это «самым быстрым ростом релиза, который видела платформа». На Arena.ai K3 занял первое место на Frontend Code Arena с 1679 очками, обойдя Claude Fable 5 — прыжок на 17 позиций по сравнению с Kimi K2.6 (с 18-го места на 1-е). Первое место в 6 из 7 доменов теста (маркетинг, дизайн по референсу, аналитика данных, потребительские продукты, симуляции, контент-инструменты), и только в категории игр K3 уступает Fable 5. Nathan Lambert из Interconnects написал прямо: «это явно сильнейшая открытая модель из всех выпущенных», и заметил, что разрыв между открытыми и закрытыми моделями (а заодно между американскими и китайскими лабораториями) сжался с обсуждаемых 6–9 месяцев до 3–5.
Но сообщество нашло и поводы для скепсиса. Независимый security-бенчмарк от Semgrep показал у K3 точность (precision) 0.684 на guided-prompt тестах — заметно ниже, чем у конкурентов (у всех прочих моделей теста — 0.84–0.91), то есть K3 чаще ошибочно помечает безопасный код как уязвимый. На самом крупном enterprise-репозитории теста результат просел до ~6% F1 против ~20% у GLM и других фронтир-моделей. Отдельно — находка, которую собрал в своём разборе Zvi Mowshowitz: по наблюдениям нескольких независимых тестеров, K3 иногда называет себя Claude (по одной оценке — примерно в 1 из 10 диалогов) и воспроизводит характерные для Claude паттерны форматирования и рассуждений. Moonshot это не комментировала, и прямых доказательств дистилляции из чужой модели нет — но и опровержения тоже.
Часть 4: Контекст и позиционирование
K3 вышел не в вакууме. Qwen3.8-Max-Preview от Alibaba — 2.4T параметров всего (заявление самой Alibaba, число активных параметров не раскрыто), анонсирован 19 июля 2026 на том же WAIC в Шанхае — за восемь дней до полных весов K3. Доступен через Token Plan, Qoder и QoderWork. Alibaba заявляет «уступает только Claude Fable 5» — но это непроверенное заявление вендора: независимого бенчмарка под него на момент написания нет.
DeepSeek V4 — две модели: V4-Pro (1.6T total / 49B active) и V4-Flash (284B total / 13B active), обе вышли 24 апреля 2026 и по умолчанию несут 1M контекста. Это на несколько месяцев раньше K3 и Qwen3.8-Max — часть той же волны, просто более ранняя.
Три разные лаборатории — Moonshot, Alibaba, DeepSeek — выкатили MoE-модели на триллион с лишним параметров в пределах одного полугодия. Гонка открытых весов не остывает, она разгоняется: закрытый фронтир больше не единственная лига, где решается, у кого модель мощнее.
TL;DR
Модель на 2.8 триллиона параметров, которая не проигрывает закрытому фронтиру 1.6 пункта и при этом технически объясняет, почему её вообще можно инферить — редкое сочетание. KDA здесь — причина, по которой экономика вообще сходится на такой разреженности. 🫡
Источники
- moonshotai/Kimi-K3 — GitHub
- SWE-bench Verified — vals.ai
- moonshotai/Kimi-K3 — Simon Willison’s Weblog
- Kimi Linear Technical Report — Moonshot AI (arXiv:2510.26692)
- Moonshot Opens Kimi K3 Weights Under a Revenue-Tiered License — Unite.AI
- Kimi K3 License Sets $20 Million Commercial Threshold — implicator.ai
- Kimi K3 Architecture Notes — Sebastian Raschka
- Attention Residuals Technical Report — Kimi Team (arXiv:2603.15031)
- Qwen 3.8 Benchmarks: What’s Actually Verified So Far — Yotta Labs
- DeepSeek V4: 1.6T MoE, 1M Context — MorphLLM
- Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3 (arXiv:2607.24653)
- Kimi K3 Achieves #3 in the Artificial Analysis Intelligence Index — Artificial Analysis
- Kimi K3 — Vision Evals — Roboflow
- Kimi-K3-GGUF — Unsloth Docs
- Kimi K3 Day-0 Support — vLLM Blog
- Moonshot AI Releases Kimi K3’s Weights, Sees Fastest Release Growth Ever on Hugging Face — Officechai
- Kimi K3 Tops Frontend Code Arena — Arena.ai / Hacker News
- Kimi K3: The Open-Weights Escalation — Nathan Lambert, Interconnects
- Kimi K3’s Code Security Results Lack Precision — Semgrep
- On Kimi K3, Its Capabilities, and Related — Zvi Mowshowitz
- vLLM Now Supports Qwen3-Next: Hybrid Architecture with Extreme Efficiency — vLLM Blog
- Why Did M2 End Up as a Full Attention Model? — MiniMax

