Все статьи
Артемий Мазаев·· 14 мин чтения

Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡

Kimi K3 от Moonshot AI — 2.8T параметров, 104B активных, экстремальная MoE-разреженность и Kimi Delta Attention: тот же гибрид линейного и полного внимания на 3:1, что в пейпере Kimi Linear обещал до 6× ускорения декодинга на длинном контексте.

Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡

Ну чё, малютки, редкий случай: open-weight модель отстаёт от закрытого фронтира на реальном бенчмарке всего на 1.6 пункта. Не «почти догнала на маркетинговом слайде» — 1.6 пункта на честном SWE-bench Verified, который каждый может перепроверить сам. Обычно вопрос к таким релизам: «что там нового внутри». В этот раз интереснее другой: как вообще эксплуатировать 2.8 триллиона параметров и не проиграть по скорости лабам с бесконечным бюджетом на инференс.

Встречайте Kimi K3 от Moonshot AI. Предыдущая модель этой линейки — Kimi K2.5 — тоже разбирал отдельно, и там главный сюжет был про дистрибуцию и агентский рой. В этот раз сюжет — архитектурный: как устроена экономика инференса модели такого размера.

🔥Суть за 10 секунд

16 июля 2026 — Moonshot AI анонсирует Kimi K3 на WAIC в Шанхае, модель сразу доступна через API. 27 июля — выкладывают полные веса: 2.8T параметров всего, 104B активных, 896 экспертов (16 роутизируемых + 2 shared на токен), контекст 1M токенов. SWE-bench Verified показывает 93.40%, в 1.6 пункта от Claude Fable 5 (95.00%). Внутри работает Kimi Delta Attention (KDA): гибрид линейного и полного внимания 3:1, который в пейпере Kimi Linear обещал до 6× ускорения декодинга на 1M-контексте — правда, для модели куда меньшего размера.


Часть 1: Что внутри Kimi K3

Голые цифры сначала. Всего в модели 2.8 триллиона параметров, но на каждый токен активируется только 104 миллиарда — MoE в чистом виде. Экспертов у роутера 896, из них на токен включаются 16 плюс 2 постоянно активных shared-эксперта — это меньше 1.8% от общего пула роутизируемых экспертов на один проход. Даже по меркам 2026 года это экстремальная разреженность. Саму механику роутинга и top-k выбора я подробно разбирал в статье про MoE. Здесь не буду повторяться, просто фиксирую новую точку данных: вот насколько разреженной оказалась конфигурация в проде.

16 из 896Активных экспертов

Плюс 2 always-on shared-эксперта. Итого на токен работает ≈1.8% роутизируемых экспертов — экстремальная разреженность даже для MoE-флагмана 2026 года.

1M токеновКонтекст

Полный миллион токенов контекста «из коробки». Reasoning включён всегда — три уровня усилия: low / high / max, а не тумблер «думать или нет».

Зрение здесь нативное, не приклеенный сбоку энкодер: под капотом MoonViT-V2 на 401M параметров. По независимым Vision Evals от Roboflow модель берёт в среднем 66.5% на шести визуальных задачах (15-е место из 23), но на OCR это одна из сильнейших моделей теста: 93.0%, 4-е место из 23. Таймлайн релиза плотный: 16 июля — анонс и доступ через API, 27 июля — полные веса в открытом доступе (порядка 1.5 ТБ на диске, если качать всё разом).

⚠️Лицензия сменилась — это не мелочь

Kimi K2 и K2.5 шли под «Modified MIT» — фактически permissive-лицензией. K3 переходит на новую, авторскую «Kimi K3 License»: это реальный сдвиг условий, не косметика. Если строишь MaaS-бизнес (продаёшь доступ к инференсу или файнтюну третьим лицам) и он зарабатывает больше $20M за 12 месяцев — нужен отдельный договор с Moonshot. А если продукт разрастается больше 100M MAU, то обязательно отображение атрибуции «Kimi K3» в интерфейсе. Локальный запуск и файнтюн для своих нужд — без ограничений.

Доступ — с первого дня. API самого Moonshot заработал ещё 16 июля по цене $3 за 1M входных токенов и $15 за 1M выходных — столько же просят сторонние провайдеры на OpenRouter (семь штук на день релиза, у всех те же ставки).

Запуск: vLLM, SGLang и что для этого реально нужно

День-0 поддержка есть и в vLLM, и в SGLang, но обе явно рассчитаны не на домашний стенд. Минимальное железо, которое называет сам Moonshot, — одна нода 8×B300 (или GB300 NVL72). Меньше не встанет: даже с MXFP4/MXFP8-квантованием, родным для K3 (см. Часть 2), модель просто не влезает.

vLLM:

vllm serve moonshotai/Kimi-K3 \
  --tensor-parallel-size 8 \
  --trust-remote-code \
  --load-format fastsafetensors \
  --enable-prefix-caching \
  --enable-auto-tool-choice \
  --tool-call-parser kimi_k3 \
  --reasoning-parser kimi_k3

На GB300 NVL72 в конфигурации TP8 это даёт 111 токенов/с на пользователя (батч 1, без спекулятивного декодинга), TP16 — 118 токенов/с. Со спекулятивным декодингом DSpark (добавляется флагом --speculative-config с моделью Inferact/Kimi-K3-DSpark) цифры вырастают почти в 3 раза: 331 ток/с на TP8 и 370 ток/с на TP16.

SGLang идёт похожим путём — точные флаги живут в официальном cookbook, из общедоступного упоминается --enable-unified-memory — и на связке из 8 GB300 даёт сопоставимые 113 ток/с без спекуляции и ≈423 ток/с с DSpark. Это цифры на одного пользователя; в дисагрегированной конфигурации (prefill отдельно от decode) агрегированная пропускная способность кластера доходит до 2800+ токенов/с на GPU — но это уже метрика для прод-serving под нагрузкой, а не то, что почувствует один клиент.

Если восьми B300 под рукой нет, остаётся локальный путь через кванты. Unsloth уже выкатил динамические GGUF: UD-Q8_K_XL (1.6 ТБ) заявлен как «по-настоящему безлоссовый», UD-2bit — 880 ГБ, UD-IQ1_S — уже около 650 ГБ ценой части качества. Правило простое: суммы RAM и VRAM должно хватать примерно на размер кванта, иначе включается offloading и всё резко замедляется. Запуск — обычный llama.cpp:

./llama.cpp/llama-cli \
  --model unsloth/Kimi-K3-GGUF/UD-IQ1_S/Kimi-K3-UD-IQ1_M-00001-of-00015.gguf \
  --mmproj unsloth/Kimi-K3-GGUF/mmproj-F16.gguf \
  --temp 1.0 --top-p 0.95

650 гигабайт всё равно не влезут ни в одну домашнюю видеокарту — но это уже не восемь дата-центровых ускорителей, а условный сервер с достаточным объёмом RAM, пусть и медленно.

🖥️ Чем это запускать
Пять вариантов — от дата-центрового кластера до самого дешёвого локального кванта. Ни один не влезет в домашнюю видеокарту.
Железо8×B300 / GB300 NVL72 — минимум, который называет сам Moonshot
РазмерMXFP4/MXFP8, ~1.4–1.6 ТБ весов
Throughput111 ток/с на пользователя → 331 ток/с с DSpark (батч 1)
НюансПрод-инференс. Меньше этой конфигурации модель просто не встаёт.

Бенчмарки — где K3 в ряду фронтира

📊 SWE-bench Verified: где K3 среди фронтира
Данные vals.ai на 22 июля 2026. Нажми на строку для деталей. Qwen3.8-Max и DeepSeek V4 здесь нет — у них пока нет независимо подтверждённых цифр по этому бенчмарку.
GPT-5.6 Sol96.2%
Claude Fable 595%
Kimi K393.4%
Claude Opus 4.888.6%

93.40% против 95.00% у Claude Fable 5 — закрытый фронтир и открытые веса оказались в 1.6 пункта друг от друга на реальном бенчмарке, не на маркетинговом слайде. При этом K3 уже обходит прошлый топ Anthropic, Claude Opus 4.8 (88.60%), и уступает только GPT-5.6 Sol (96.20%).

SWE-bench — только одна точка на карте. По сводному Intelligence Index от Artificial Analysis, который усредняет добрый десяток бенчмарков, у K3 третье место (57 баллов) — позади Fable 5 и GPT-5.6 Sol, но вровень с Claude Opus 4.8. На отдельных срезах K3 даже обгоняет Opus 4.8: в GDPval-AA v2 — 1668 против 1600 Elo.

1.6 пунктаРазрыв до Fable 5

95.00% − 93.40% = 1.6 пункта. Дистанция между открытыми весами и самой мощной моделью Anthropic на момент выхода K3 — на честном SWE-bench Verified, без урезанных сетапов.

Специально не в сравнении: Qwen3.8-Max-Preview и DeepSeek V4. Не потому что забыл — потому что у обеих на момент написания нет чистых, независимо подтверждённых цифр по этому бенчмарку. У Alibaba для Qwen3.8-Max-Preview до сих пор не опубликован ни model card, ни таблица бенчмарков — только доступ через API и заявление «уступает только Fable 5» без методологии. У DeepSeek V4 цифры по SWE-bench расходятся между вторичными источниками — единого подтверждённого числа нет. Это честный пробел в сравнении, а не недосмотр.


Часть 2: Kimi Delta Attention

Тот же тезис «decode упирается в память» уже звучал в статьях про KV-кэш и FlashAttention. FlashAttention атаковал вопрос как память читается — IO-aware тайлинг, без изменения того, что вообще хранится в KV-кэше. Kimi Delta Attention (KDA) заходит с другой стороны: атакует вопрос сколько вообще нужно хранить, заменяя большую часть слоёв внимания на вариант линейного внимания с состоянием фиксированного размера — вместо растущего с каждым токеном KV-кэша.

Механика (терминология — из самого пейпера Kimi Linear): KDA расширяет Gated DeltaNet более тонким гейтингом, чтобы эффективнее использовать конечную RNN-память состояния. Поверх работает специальный chunkwise-алгоритм над частным случаем Diagonal-Plus-Low-Rank (DPLR) переходных матриц, заточенный под эффективность на железе. По официальному README репозитория, слоёв всего 93: 69 KDA и 24 Gated MLA (полное внимание) — реальное соотношение чуть точнее заявленных «3:1», это 2.9 линейных слоя на один полный. Основную массу вычислений тащит дешёвое линейное внимание, а каждый четвёртый слой держит полное внимание — там, где линейному варианту одному не хватает моделирующей мощности.

Отдельно, вторым и отдельно опубликованным механизмом, в K3 используется Attention Residuals (arXiv 2603.15031, тоже Kimi Team): вместо стандартного накопления residual-связей с фиксированными весами — softmax-внимание поверх выходов предыдущих слоёв. Решает проблему «размытого вклада» слоёв в очень глубоких сетях, когда обычный residual-механизм плохо различает, какой из полусотни предыдущих слоёв реально что-то привнёс. K3 использует масштабируемый вариант этого механизма — Block AttnRes.

⚡ Full attention vs KDA-гибрид
Выбери длину контекста — увидишь относительную скорость декодинга и относительный объём KV-кэша, full attention vs KDA-гибрид (3:1). Цифры из пейпера Kimi Linear, для исследовательской модели (48B/3B), не для продакшен K3 напрямую.
Скорость декодинга: full attention
Скорость декодинга: KDA-гибрид6×
Объём KV-кэша: full attention100%
Объём KV-кэша: KDA-гибрид25%
На 1M контексте: до 6× быстрее декодинг (6.3× по TPOT) и до 75% экономии KV-кэша — заявлено для исследовательской модели, не переподтверждено отдельно для K3. (бенчмарк: заявлено в пейпере)

И вот тут — важная оговорка. Цифры до 6× ускорения декодинга и до 75% экономии KV-кэша на 1M-контексте — из пейпера Kimi Linear, и относятся они к исследовательской модели 48B total / 3B active, не к продакшен K3. Kimi K3 использует тот же механизм KDA, но уже на масштабе 2.8T/104B — и ни в одном первоисточнике Moonshot эти множители отдельно для K3 не переподтверждены. Механизм тот же, а вот 6×/75% — унаследованная формулировка из пейпера про модель другого размера, а не независимо измеренный результат для самого K3. Это не значит, что для K3 эффект отсутствует — просто утверждать конкретное число некорректно, пока Moonshot не опубликует отдельные цифры.

И ещё одна честная поправка — уже не про цифры, а про саму идею. Гибрид линейного и полного внимания — не изобретение Kimi. Qwen3-Next (Alibaba, сентябрь 2025) уже гонял точно такое же соотношение 3:1: Gated DeltaNet на трёх слоях из четырёх, полное внимание на четвёртом. MiniMax-Text-01 (январь 2025, 456B параметров) сделал это ещё раньше, просто с другим шагом — один слой softmax-внимания на каждые семь Lightning Attention. Даже сам механизм KDA — более тонкий, по-канальный гейтинг вместо по-голового у Gated DeltaNet — описан ещё в пейпере Kimi Linear, до K3. Настоящая новизна K3 не в архитектуре гибрида как таковой, а в том, что её вообще довели до продакшена на 2.8 триллиона параметров: до сих пор никто не показывал, что этот класс архитектур держится на фронтир-масштабе.

🕰️ Кто первым сделал гибрид
Гибридное линейное и полное внимание существовало до Kimi K3 — вот кто и когда добрался туда первым.
Январь 2025
MiniMax-Text-01
456B всего / 45.9B активных. Lightning Attention: 1 слой softmax-внимания на каждые 7 линейных (80 слоёв всего). Первый гибрид линейного и полного внимания на таком масштабе.
Сентябрь 2025
Qwen3-Next
80B всего / 3B активных. Gated DeltaNet в соотношении 3:1 — каждый 4-й слой держит полное внимание. Ровно та же пропорция, что потом заявит K3.
Октябрь 2025
Kimi Linear (пейпер)
arXiv 2510.26692, исследовательская модель 48B всего / 3B активных. Здесь впервые описан сам механизм KDA — более тонкий, по-канальный гейтинг вместо по-голового у Gated DeltaNet. Заявлено до 6× ускорения декодинга и 75% экономии KV-кэша.
Июль 2026
Kimi K3
2.8T всего / 104B активных, 93 слоя (69 KDA + 24 Gated MLA). Тот же класс архитектуры, что и три пункта выше, но впервые — на фронтир-масштабе.

Но есть и повод для настороженности. У MiniMax гибрид на небольшом масштабе шёл вровень с полным вниманием на стандартных бенчмарках (MMLU, BBH, MATH, LongBench) — а на большем масштабе всплыл явный провал именно на сложных multi-hop reasoning-задачах, где нужно последовательно опираться на несколько разнесённых по контексту фактов. Кончилось тем, что MiniMax откатила следующую модель, M2, обратно на полное внимание по всем слоям. Прямых доказательств, что K3 наступает на те же грабли, нет — но и доказательств обратного тоже: заявленные 6×/75% для K3 никто отдельно не переподтвердил (см. выше), а независимых замеров качества K3 именно на длинных multi-hop-цепочках пока не публиковали.

Про LatentMoE, впрочем, неопределённости больше нет: и README репозитория, и собственный техотчёт Moonshot по K3 (arXiv:2607.24653, «Kimi K3: Open Frontier Intelligence») прямо называют этот компонент — Stable LatentMoE, сжатие MoE-роутинга по аналогии с тем, как MLA сжимает attention. Тот же техотчёт заявляет ~2.5× улучшение эффективности скейлинга по сравнению с K2.5 — K3 логично продолжает тренд: MoE → LatentMoE, обычное внимание → Gated MLA и KDA, всё в сторону дешёвого инференса без потери качества. Из более мелких деталей: активация здесь SiTU-GLU, а веса и активации обучались сразу в MXFP4/MXFP8 как часть тренировки (quantization-aware training), а не квантуются постфактум. По независимым разборам архитектуры (сама Moonshot это отдельно не расписывает) не обошлось и без апгрейда оптимизатора: MuonClip из K2 (Muon + QK-Clip против взрыва attention-логитов) в K3 превращается в Per-Head Muon — тот же принцип, но применяется к каждой attention-голове по отдельности.


Часть 3: Приём — цифры и споры

Реакция на релиз оказалась быстрой и двойственной.

Сначала цифры. На Hugging Face K3 за первые 30 минут после выкладки весов 27 июля набрал больше 4000 лайков и вышел в топ трендов — CEO платформы Клеман Деланг назвал это «самым быстрым ростом релиза, который видела платформа». На Arena.ai K3 занял первое место на Frontend Code Arena с 1679 очками, обойдя Claude Fable 5 — прыжок на 17 позиций по сравнению с Kimi K2.6 (с 18-го места на 1-е). Первое место в 6 из 7 доменов теста (маркетинг, дизайн по референсу, аналитика данных, потребительские продукты, симуляции, контент-инструменты), и только в категории игр K3 уступает Fable 5. Nathan Lambert из Interconnects написал прямо: «это явно сильнейшая открытая модель из всех выпущенных», и заметил, что разрыв между открытыми и закрытыми моделями (а заодно между американскими и китайскими лабораториями) сжался с обсуждаемых 6–9 месяцев до 3–5.

Но сообщество нашло и поводы для скепсиса. Независимый security-бенчмарк от Semgrep показал у K3 точность (precision) 0.684 на guided-prompt тестах — заметно ниже, чем у конкурентов (у всех прочих моделей теста — 0.84–0.91), то есть K3 чаще ошибочно помечает безопасный код как уязвимый. На самом крупном enterprise-репозитории теста результат просел до ~6% F1 против ~20% у GLM и других фронтир-моделей. Отдельно — находка, которую собрал в своём разборе Zvi Mowshowitz: по наблюдениям нескольких независимых тестеров, K3 иногда называет себя Claude (по одной оценке — примерно в 1 из 10 диалогов) и воспроизводит характерные для Claude паттерны форматирования и рассуждений. Moonshot это не комментировала, и прямых доказательств дистилляции из чужой модели нет — но и опровержения тоже.

📡 Как отреагировал мир
Две стороны одного релиза — переключи вкладку.
1679
очков на Frontend Code Arena — #1, обошёл Claude Fable 5, прыжок с 18-го места у Kimi K2.6
🥇Brand & Marketing
🥇Reference-Based Design
🥇Data & Analytics
🥇Consumer Product
🥇Simulations
🥇Content Creation Tools
🥈Gaming
Плюс HF: 4000+ лайков за первые 30 минут после выкладки весов, топ трендов — по словам CEO платформы, «самый быстрый рост релиза, который видела платформа».

Часть 4: Контекст и позиционирование

K3 вышел не в вакууме. Qwen3.8-Max-Preview от Alibaba — 2.4T параметров всего (заявление самой Alibaba, число активных параметров не раскрыто), анонсирован 19 июля 2026 на том же WAIC в Шанхае — за восемь дней до полных весов K3. Доступен через Token Plan, Qoder и QoderWork. Alibaba заявляет «уступает только Claude Fable 5» — но это непроверенное заявление вендора: независимого бенчмарка под него на момент написания нет.

DeepSeek V4 — две модели: V4-Pro (1.6T total / 49B active) и V4-Flash (284B total / 13B active), обе вышли 24 апреля 2026 и по умолчанию несут 1M контекста. Это на несколько месяцев раньше K3 и Qwen3.8-Max — часть той же волны, просто более ранняя.

🌍 Кто ещё выкатил триллион+ параметров в это полугодие
Три лаборатории, четыре модели, одно полугодие — переключай вкладки.
Kimi K3
РазработчикMoonshot AI
Параметры2.8T всего / 104B активных
Контекст1M токенов
Дата27 июля 2026 (анонс 16 июля)
SWE-benchSWE-bench Verified 93.40% — подтверждено на vals.ai
ДоступностьОткрытые веса (Kimi K3 License, revenue-triggered) + API

Три разные лаборатории — Moonshot, Alibaba, DeepSeek — выкатили MoE-модели на триллион с лишним параметров в пределах одного полугодия. Гонка открытых весов не остывает, она разгоняется: закрытый фронтир больше не единственная лига, где решается, у кого модель мощнее.


TL;DR

1Масштаб: 2.8T параметров всего, 104B активных, 896 экспертов (16 + 2 shared на токен, ≈1.8% активной доли), 1M контекста, 93 слоя (69 KDA + 24 Gated MLA)
2Бенчмарк: SWE-bench Verified 93.40% — в 1.6 пункта от Claude Fable 5, уже выше Claude Opus 4.8; по сводному Intelligence Index от Artificial Analysis — третье место
3Доступ: $3/$15 за 1M токенов у самого Moonshot и на OpenRouter; день-0 поддержка в vLLM/SGLang, но минимум — нода 8×B300 (118–423 ток/с в зависимости от движка и спекулятивного декодинга); локально — GGUF-кванты от Unsloth от 650 ГБ
4KDA: гибрид линейного (Gated DeltaNet + чанковый DPLR-алгоритм) и полного внимания — атакует объём хранимого состояния, а не только скорость доступа к нему
5Честная оговорка: 6× декодинг и 75% экономии KV-кэша — цифры для модели 48B/3B, не переподтверждены для K3; сам гибрид линейного и полного внимания придумали не в Kimi — Qwen3-Next и MiniMax были раньше, новизна K3 — в масштабе
6Приём: #1 на Hugging Face trending и на Frontend Code Arena (1679 очков, обошёл Fable 5) — но и находки скептиков: слабая точность на security-бенчмарке Semgrep и следы возможной дистилляции из Claude
7Контекст: лицензия сменилась с Modified MIT на revenue-triggered Kimi K3 License; открытые веса на триллион+ параметров теперь выпускают три разные лаборатории за одно полугодие

Модель на 2.8 триллиона параметров, которая не проигрывает закрытому фронтиру 1.6 пункта и при этом технически объясняет, почему её вообще можно инферить — редкое сочетание. KDA здесь — причина, по которой экономика вообще сходится на такой разреженности. 🫡


Источники

  1. moonshotai/Kimi-K3 — GitHub
  2. SWE-bench Verified — vals.ai
  3. moonshotai/Kimi-K3 — Simon Willison’s Weblog
  4. Kimi Linear Technical Report — Moonshot AI (arXiv:2510.26692)
  5. Moonshot Opens Kimi K3 Weights Under a Revenue-Tiered License — Unite.AI
  6. Kimi K3 License Sets $20 Million Commercial Threshold — implicator.ai
  7. Kimi K3 Architecture Notes — Sebastian Raschka
  8. Attention Residuals Technical Report — Kimi Team (arXiv:2603.15031)
  9. Qwen 3.8 Benchmarks: What’s Actually Verified So Far — Yotta Labs
  10. DeepSeek V4: 1.6T MoE, 1M Context — MorphLLM
  11. Kimi K3: Open Frontier Intelligence — Technical Report of Kimi K3 (arXiv:2607.24653)
  12. Kimi K3 Achieves #3 in the Artificial Analysis Intelligence Index — Artificial Analysis
  13. Kimi K3 — Vision Evals — Roboflow
  14. Kimi-K3-GGUF — Unsloth Docs
  15. Kimi K3 Day-0 Support — vLLM Blog
  16. Moonshot AI Releases Kimi K3’s Weights, Sees Fastest Release Growth Ever on Hugging Face — Officechai
  17. Kimi K3 Tops Frontend Code Arena — Arena.ai / Hacker News
  18. Kimi K3: The Open-Weights Escalation — Nathan Lambert, Interconnects
  19. Kimi K3’s Code Security Results Lack Precision — Semgrep
  20. On Kimi K3, Its Capabilities, and Related — Zvi Mowshowitz
  21. vLLM Now Supports Qwen3-Next: Hybrid Architecture with Extreme Efficiency — vLLM Blog
  22. Why Did M2 End Up as a Full Attention Model? — MiniMax