Фундамент
15Как всё устроено внутри: KV-кэш, MoE, спекулятивный декодинг, structured outputs и харнес агента — без воды, с механикой.
фундаментРучки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲
Что на самом деле делают temperature, top-k, top-p и min-p с распределением вероятностей, в каком порядке они применяются (в vLLM и в HuggingFace он разный), что ставить под код, JSON и творчество — и почему temperature=0 всё равно не даёт детерминизма.
Читать далее
фундаментDiffusion LLM: как генерировать текст не слева-направо 🌫️⚡
Неавторегрессионная генерация текста через итеративный denoising — механика masked-diffusion (LLaDA), почему это ломает KV-кэш и чем отличается от спекулятивного декодинга, игроки (Mercury 2, NVIDIA Nemotron TwoTower) и разбор Celeris-1: заявлено vs независимо измерено.
Читать далее
фундаментПозиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐
Зачем трансформеру позиция, как RoPE поворачивает векторы на угол m·θ, почему это относительное кодирование, где оно ломается на длинном контексте и как чинят (NTK, YaRN) — плюс контртезис: Thinking Machines в Inkling выкинула RoPE. С пятью визуальными демками механики.
Читать далееLLM-бенчмарки: как считают и как их обманывают 🕵️📊
Три принципиально разных типа бенчмарков (verifiable, LLM-judge, Arena/ELO), контаминация на реальных цифрах GSM1k, оверфит под лидерборд на примере Llama 4 Maverick — и кульминация: агент OpenAI взломал прод Hugging Face, пытаясь украсть ответы к собственному eval вместо честного решения.
Читать далееПост-тренинг LLM: RLHF → DPO → GRPO 🎯🧮
Как LLM учат вести себя хорошо после претрейна — эволюция четырёх алгоритмов за три года: PPO с критик-сетью (InstructGPT, 2022), DPO без RL-петли (2023), GRPO без критика (DeepSeekMath, 2024) и DAPO, который чинит баги ванильного GRPO (2025). Формулы из первоисточников, NumPy-проверенный численный пример.
Читать далееFlashAttention: как реально считается attention на GPU ⚡🧮
FlashAttention простыми словами: почему naive attention упирается в HBM bandwidth, как тайлинг и online softmax убирают лишний трафик через память, и что изменилось в v2/v3. С кодом и интерактивом.
Читать далееRAG: полное пособие — механики, архитектуры, код 📚🔍
Разбираю RAG целиком: чанкинг, эмбеддинги, векторный поиск, hybrid search, reranking, оценка качества, архитектуры от naive до GraphRAG, рабочий код и опенсорс.
Читать далее
фундаментТокенизация: почему русский текст дороже английского 🔤💸
Разбираю BPE: как строится словарь субслов и почему кириллица режется на больше токенов, чем латиница. С токенизатором OpenAI и тренажёром BPE в браузере.
Читать далееMCP изнутри: протокол по спекам — от JSON-RPC до Tasks 🔌📡
Model Context Protocol по спецификации: архитектура, транспорты, жизненный цикл, эволюция по 4 версиям (2024-11-05 → 2025-11-25) и что нового в Tasks.
Читать далее
фундаментСпекулятивный декодинг: ускоряем LLM в 2–3 раза 🏎️💨
Спекулятивный декодинг: почему декод простаивает GPU и как черновик с редактором ускоряют генерацию без потери качества — EAGLE, Medusa, MTP, vLLM.
Читать далее
фундаментMoE изнутри: как 17B активных бьют 70B плотных 🧠🎛️
Mixture-of-Experts изнутри: где живут эксперты, как роутер выбирает top-k, почему без load balancing всё коллапсирует и что такое top-k routing.
Читать далееStructured Outputs: как получить от LLM валидный JSON 🔫📋
Constrained decoding: почему «отвечай строго JSON» не работает и как logit masking делает невалидный вывод невозможным — Outlines, XGrammar, vLLM.
Читать далее
фундаментKV-кэш: почему LLM помнит без памяти и жрёт VRAM 🧠💾
KV-кэш простыми словами: зачем нужен, почему без него генерация была бы в разы медленнее и почему из-за него OOM на длинном контексте. С калькулятором VRAM.
Читать далее
фундаментХарнес агента: что превращает LLM в автономного работягу 🫡
Харнес агента — обвязка вокруг LLM: цикл, вызов инструментов, контекст, песочница. Как жили без харнеса и минимальный пример на 20 строк Python.
Читать далее
фундаментКвантизация LLM: Как запихнуть 70B модель в твою видюху 🫡
Разбираю квантизацию LLM по полочкам — от FP32 до INT4, GPTQ, AWQ, GGUF, MoE и практические примеры. Без воды, с кодом и шизой.
Читать далее