ЭЙ АЙ ШИЗ
ГлавнаяСтатьиОбо мне
ГлавнаяСтатьиОбо мне

Все статьи

27

Мои мысли, заметки и статьи на разные темы

фундамент 15тулы 5модели 5хайп 2
Собери свой Claude Code: кодовый агент на tool-calling за 166 строк 🤖🔧Новоетулы
2 августа 2026 г.17 мин

Собери свой Claude Code: кодовый агент на tool-calling за 166 строк 🤖🔧

Пошаговый туториал: пишем кодового агента, который читает репозиторий, правит код и сам гоняет тесты до зелёного. Чистый Python и openai SDK, без фреймворков. Работает на Cloud.ru Foundation Models и на любом OpenAI-совместимом endpoint — локальном vLLM, Ollama, OpenRouter.

Читать далее
Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲фундамент
2 августа 2026 г.15 мин

Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲

Что на самом деле делают temperature, top-k, top-p и min-p с распределением вероятностей, в каком порядке они применяются (в vLLM и в HuggingFace он разный), что ставить под код, JSON и творчество — и почему temperature=0 всё равно не даёт детерминизма.

Читать далее
Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡фундамент
1 августа 2026 г.7 мин

Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡

Неавторегрессионная генерация текста через итеративный denoising — механика masked-diffusion (LLaDA), почему это ломает KV-кэш и чем отличается от спекулятивного декодинга, игроки (Mercury 2, NVIDIA Nemotron TwoTower) и разбор Celeris-1: заявлено vs независимо измерено.

Читать далее
Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐фундамент
1 августа 2026 г.7 мин

Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐

Зачем трансформеру позиция, как RoPE поворачивает векторы на угол m·θ, почему это относительное кодирование, где оно ломается на длинном контексте и как чинят (NTK, YaRN) — плюс контртезис: Thinking Machines в Inkling выкинула RoPE. С пятью визуальными демками механики.

Читать далее
Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡модели
29 июля 2026 г.14 мин

Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡

Kimi K3 от Moonshot AI — 2.8T параметров, 104B активных, экстремальная MoE-разреженность и Kimi Delta Attention: тот же гибрид линейного и полного внимания на 3:1, что в пейпере Kimi Linear обещал до 6× ускорения декодинга на длинном контексте.

Читать далее
🕵📊
фундамент
29 июля 2026 г.9 мин

LLM-бенчмарки: как считают и как их обманывают 🕵️📊

Три принципиально разных типа бенчмарков (verifiable, LLM-judge, Arena/ELO), контаминация на реальных цифрах GSM1k, оверфит под лидерборд на примере Llama 4 Maverick — и кульминация: агент OpenAI взломал прод Hugging Face, пытаясь украсть ответы к собственному eval вместо честного решения.

Читать далее
🎯🧮
фундамент
29 июля 2026 г.8 мин

Пост-тренинг LLM: RLHF → DPO → GRPO 🎯🧮

Как LLM учат вести себя хорошо после претрейна — эволюция четырёх алгоритмов за три года: PPO с критик-сетью (InstructGPT, 2022), DPO без RL-петли (2023), GRPO без критика (DeepSeekMath, 2024) и DAPO, который чинит баги ванильного GRPO (2025). Формулы из первоисточников, NumPy-проверенный численный пример.

Читать далее
🤖🦁
тулы
28 июля 2026 г.10 мин

AI-агенты 2026: зоопарк харнесов, ассистентов и экспериментов 🤖🦁

Claude Code, Codex, OpenCode, Hermes Agent, Cursor, Aider, Devin, Gemini CLI — coding-агенты. OpenClaw и его экосистема — персональные ассистенты. Плюс AI-компаньон и self-modifying эксперимент. 15 инструментов, честно разложенные по категориям.

Читать далее
⚡🧮
фундамент
28 июля 2026 г.10 мин

FlashAttention: как реально считается attention на GPU ⚡🧮

FlashAttention простыми словами: почему naive attention упирается в HBM bandwidth, как тайлинг и online softmax убирают лишний трафик через память, и что изменилось в v2/v3. С кодом и интерактивом.

Читать далее
📚🔍
фундамент
27 июля 2026 г.17 мин

RAG: полное пособие — механики, архитектуры, код 📚🔍

Разбираю RAG целиком: чанкинг, эмбеддинги, векторный поиск, hybrid search, reranking, оценка качества, архитектуры от naive до GraphRAG, рабочий код и опенсорс.

Читать далее
Токенизация: почему русский текст дороже английского 🔤💸фундамент
27 июля 2026 г.7 мин

Токенизация: почему русский текст дороже английского 🔤💸

Разбираю BPE: как строится словарь субслов и почему кириллица режется на больше токенов, чем латиница. С токенизатором OpenAI и тренажёром BPE в браузере.

Читать далее
🔌📡
фундамент
26 июля 2026 г.11 мин

MCP изнутри: протокол по спекам — от JSON-RPC до Tasks 🔌📡

Model Context Protocol по спецификации: архитектура, транспорты, жизненный цикл, эволюция по 4 версиям (2024-11-05 → 2025-11-25) и что нового в Tasks.

Читать далее
Спекулятивный декодинг: ускоряем LLM в 2–3 раза 🏎️💨фундамент
26 июля 2026 г.9 мин

Спекулятивный декодинг: ускоряем LLM в 2–3 раза 🏎️💨

Спекулятивный декодинг: почему декод простаивает GPU и как черновик с редактором ускоряют генерацию без потери качества — EAGLE, Medusa, MTP, vLLM.

Читать далее
MoE изнутри: как 17B активных бьют 70B плотных 🧠🎛️фундамент
23 июля 2026 г.8 мин

MoE изнутри: как 17B активных бьют 70B плотных 🧠🎛️

Mixture-of-Experts изнутри: где живут эксперты, как роутер выбирает top-k, почему без load balancing всё коллапсирует и что такое top-k routing.

Читать далее
🔫📋
фундамент
22 июля 2026 г.11 мин

Structured Outputs: как получить от LLM валидный JSON 🔫📋

Constrained decoding: почему «отвечай строго JSON» не работает и как logit masking делает невалидный вывод невозможным — Outlines, XGrammar, vLLM.

Читать далее
Guardrails LLM Filter: секреты не уедут к LLM-провайдеру 🛡️🔑тулы
20 июля 2026 г.10 мин

Guardrails LLM Filter: секреты не уедут к LLM-провайдеру 🛡️🔑

Разбираю guardrails-llm-filter — открытый прокси, маскирующий PII и секреты по пути к LLM. Погонял демо: карты, СНИЛС, ключи AWS, вся веб-консоль.

Читать далее
KV-кэш: почему LLM помнит без памяти и жрёт VRAM 🧠💾фундамент
25 июня 2026 г.7 мин

KV-кэш: почему LLM помнит без памяти и жрёт VRAM 🧠💾

KV-кэш простыми словами: зачем нужен, почему без него генерация была бы в разы медленнее и почему из-за него OOM на длинном контексте. С калькулятором VRAM.

Читать далее
🎻🖥
тулы
25 июня 2026 г.7 мин

NVIDIA Dynamo: дирижёр для инференса на целый дата-центр 🎻🖥️

NVIDIA Dynamo — оркестратор инференса на дата-центр: KV-aware роутинг, disaggregated prefill/decode, KVBM, Planner и как всё это запустить.

Читать далее
📄👁
модели
25 июня 2026 г.5 мин

Unlimited-OCR от Baidu: читает страницу как картинку 📄👁️

Unlimited-OCR от Baidu — 3B vision-language модель для OCR документов в духе DeepSeek-OCR: оптическое сжатие, режимы gundam/base, запуск через SGLang.

Читать далее
Харнес агента: что превращает LLM в автономного работягу 🫡фундамент
17 июня 2026 г.9 мин

Харнес агента: что превращает LLM в автономного работягу 🫡

Харнес агента — обвязка вокруг LLM: цикл, вызов инструментов, контекст, песочница. Как жили без харнеса и минимальный пример на 20 строк Python.

Читать далее
H-Neurons: 0.1% нейронов, из-за которых LLM врут 🫡модели
23 марта 2026 г.7 мин

H-Neurons: 0.1% нейронов, из-за которых LLM врут 🫡

Исследование H-Neurons из Университета Цинхуа — нейроны-галлюцинаторы в LLM, их связь с чрезмерной уступчивостью и почему корень проблемы в претрейне.

Читать далее
OpenClaw: как WhatsApp-хак порвал весь GitHub 🫡хайп
4 марта 2026 г.12 мин

OpenClaw: как WhatsApp-хак порвал весь GitHub 🫡

Как личный WhatsApp-хак стал самым звёздным проектом в истории GitHub за 4 месяца: 250K+ звёзд, конфликт с Anthropic, найм в OpenAI и тёмная сторона хайпа.

Читать далее
Инференс-движки: как перестать гонять модели вручную 🫡тулы
3 марта 2026 г.16 мин

Инференс-движки: как перестать гонять модели вручную 🫡

Разбираю инференс-движки для LLM по полочкам — vLLM, SGLang, LMDeploy, Ollama, llama.cpp. Бенчмарки, установка, настройка. Без воды, с кодом и шизой.

Читать далее
Kimi K2.5: Как KimiClaw прогрел рынок на $10 лярдмодели
2 марта 2026 г.6 мин

Kimi K2.5: Как KimiClaw прогрел рынок на $10 лярд

Kimi K2.5 от Moonshot AI — 1T параметров MoE, рой из 100 агентов с 4.5× ускорением и KimiClaw, который за 20 дней заработал больше, чем весь 2025 год.

Читать далее
Qwen3.5: Китайцы сделали модель, которая рвёт GPT-5.2 🫡модели
2 марта 2026 г.9 мин

Qwen3.5: Китайцы сделали модель, которая рвёт GPT-5.2 🫡

Разбираю Qwen3.5 от Alibaba — 397B параметров, 17B активных, MoE, нативное зрение и 201 язык. Как 3B активных параметров побеждают 22B? Разбор с шизой.

Читать далее
От Вайба к Воплощению: как SKILL-агенты убивают DevOps 🫡хайп
2 марта 2026 г.7 мин

От Вайба к Воплощению: как SKILL-агенты убивают DevOps 🫡

SKILL-ориентированные агенты, вайб-инструменты и Вайбклаудинг — будущее, где человек приносит проблему, а AI сам строит инфраструктуру.

Читать далее
Квантизация LLM: Как запихнуть 70B модель в твою видюху 🫡фундамент
1 марта 2026 г.9 мин

Квантизация LLM: Как запихнуть 70B модель в твою видюху 🫡

Разбираю квантизацию LLM по полочкам — от FP32 до INT4, GPTQ, AWQ, GGUF, MoE и практические примеры. Без воды, с кодом и шизой.

Читать далее

© 2026 ЭЙ АЙ ШИЗ

ФундаментТулыМоделиХайп