Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲фундамент
15 мин

Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲

Что на самом деле делают temperature, top-k, top-p и min-p с распределением вероятностей, в каком порядке они применяются (в vLLM и в HuggingFace он разный), что ставить под код, JSON и творчество — и почему temperature=0 всё равно не даёт детерминизма.

Читать далее
Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡фундамент
7 мин

Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡

Неавторегрессионная генерация текста через итеративный denoising — механика masked-diffusion (LLaDA), почему это ломает KV-кэш и чем отличается от спекулятивного декодинга, игроки (Mercury 2, NVIDIA Nemotron TwoTower) и разбор Celeris-1: заявлено vs независимо измерено.

Читать далее
Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐фундамент
7 мин

Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐

Зачем трансформеру позиция, как RoPE поворачивает векторы на угол m·θ, почему это относительное кодирование, где оно ломается на длинном контексте и как чинят (NTK, YaRN) — плюс контртезис: Thinking Machines в Inkling выкинула RoPE. С пятью визуальными демками механики.

Читать далее
фундамент
9 мин

LLM-бенчмарки: как считают и как их обманывают 🕵️📊

Три принципиально разных типа бенчмарков (verifiable, LLM-judge, Arena/ELO), контаминация на реальных цифрах GSM1k, оверфит под лидерборд на примере Llama 4 Maverick — и кульминация: агент OpenAI взломал прод Hugging Face, пытаясь украсть ответы к собственному eval вместо честного решения.

Читать далее
фундамент
8 мин

Пост-тренинг LLM: RLHF → DPO → GRPO 🎯🧮

Как LLM учат вести себя хорошо после претрейна — эволюция четырёх алгоритмов за три года: PPO с критик-сетью (InstructGPT, 2022), DPO без RL-петли (2023), GRPO без критика (DeepSeekMath, 2024) и DAPO, который чинит баги ванильного GRPO (2025). Формулы из первоисточников, NumPy-проверенный численный пример.

Читать далее
фундамент
10 мин

FlashAttention: как реально считается attention на GPU ⚡🧮

FlashAttention простыми словами: почему naive attention упирается в HBM bandwidth, как тайлинг и online softmax убирают лишний трафик через память, и что изменилось в v2/v3. С кодом и интерактивом.

Читать далее
фундамент
17 мин

RAG: полное пособие — механики, архитектуры, код 📚🔍

Разбираю RAG целиком: чанкинг, эмбеддинги, векторный поиск, hybrid search, reranking, оценка качества, архитектуры от naive до GraphRAG, рабочий код и опенсорс.

Читать далее
Токенизация: почему русский текст дороже английского 🔤💸фундамент
7 мин

Токенизация: почему русский текст дороже английского 🔤💸

Разбираю BPE: как строится словарь субслов и почему кириллица режется на больше токенов, чем латиница. С токенизатором OpenAI и тренажёром BPE в браузере.

Читать далее
фундамент
11 мин

MCP изнутри: протокол по спекам — от JSON-RPC до Tasks 🔌📡

Model Context Protocol по спецификации: архитектура, транспорты, жизненный цикл, эволюция по 4 версиям (2024-11-05 → 2025-11-25) и что нового в Tasks.

Читать далее
Спекулятивный декодинг: ускоряем LLM в 2–3 раза 🏎️💨фундамент
9 мин

Спекулятивный декодинг: ускоряем LLM в 2–3 раза 🏎️💨

Спекулятивный декодинг: почему декод простаивает GPU и как черновик с редактором ускоряют генерацию без потери качества — EAGLE, Medusa, MTP, vLLM.

Читать далее
MoE изнутри: как 17B активных бьют 70B плотных 🧠🎛️фундамент
8 мин

MoE изнутри: как 17B активных бьют 70B плотных 🧠🎛️

Mixture-of-Experts изнутри: где живут эксперты, как роутер выбирает top-k, почему без load balancing всё коллапсирует и что такое top-k routing.

Читать далее
фундамент
11 мин

Structured Outputs: как получить от LLM валидный JSON 🔫📋

Constrained decoding: почему «отвечай строго JSON» не работает и как logit masking делает невалидный вывод невозможным — Outlines, XGrammar, vLLM.

Читать далее
KV-кэш: почему LLM помнит без памяти и жрёт VRAM 🧠💾фундамент
7 мин

KV-кэш: почему LLM помнит без памяти и жрёт VRAM 🧠💾

KV-кэш простыми словами: зачем нужен, почему без него генерация была бы в разы медленнее и почему из-за него OOM на длинном контексте. С калькулятором VRAM.

Читать далее
Харнес агента: что превращает LLM в автономного работягу 🫡фундамент
9 мин

Харнес агента: что превращает LLM в автономного работягу 🫡

Харнес агента — обвязка вокруг LLM: цикл, вызов инструментов, контекст, песочница. Как жили без харнеса и минимальный пример на 20 строк Python.

Читать далее
Квантизация LLM: Как запихнуть 70B модель в твою видюху 🫡фундамент
9 мин

Квантизация LLM: Как запихнуть 70B модель в твою видюху 🫡

Разбираю квантизацию LLM по полочкам — от FP32 до INT4, GPTQ, AWQ, GGUF, MoE и практические примеры. Без воды, с кодом и шизой.

Читать далее