Все статьи
12Мои мысли, заметки и статьи на разные темы
НовоеGuardrails LLM Filter: чтобы твои секреты не уехали к LLM-провайдеру 🛡️🔑
Разбираю cloud-ru-tech/guardrails-llm-filter — открытый прокси, который маскирует PII и секреты по пути к LLM и возвращает оригиналы в ответе. Запустил демо, погонял карты, СНИЛС и ключи от AWS, прошёлся по всей веб-консоли: правила, песочница, теневой режим, аудит, мониторинг.
Читать далее
KV-кэш: почему LLM помнит без памяти и жрёт VRAM как не в себя 🧠💾
KV-кэш простыми словами: зачем он нужен, почему без него генерация была бы в разы медленнее, и почему именно из-за него у тебя OOM на длинном контексте. С интерактивом и калькулятором VRAM.
Читать далееNVIDIA Dynamo: дирижёр для инференса на целый дата-центр 🎻🖥️
Разбираю ai-dynamo/dynamo — открытый оркестратор инференса от NVIDIA. Зачем нужен, как устроен (KV-aware роутинг, disaggregated prefill/decode, KVBM, Planner), как обрабатывается запрос и как запустить. С mermaid-диаграммами и интерактивом.
Читать далееUnlimited-OCR от Baidu: OCR, который читает страницу как картинку 📄👁️
Разбираю baidu/Unlimited-OCR — 3B vision-language модель для распознавания документов в духе DeepSeek-OCR. Как работает оптическое сжатие, что умеет, режимы gundam/base, и как запустить через transformers и SGLang. С интерактивом.
Читать далее
Харнес агента: Что превращает тупую LLM в автономного работягу 🫡
Разбираю, что такое харнес агента — обвязка вокруг LLM, которая делает из генератора текста рабочую лошадку: цикл, вызов инструментов, контекст, песочница. Как жили без него и минимальный харнес на 20 строк Python. Без воды, с кодом и шизой.
Читать далее
H-Neurons: Как учёные нашли 0.1% нейронов, из-за которых LLM врут 🫡
Разбираю исследование H-Neurons из Университета Цинхуа — нейроны-галлюцинаторы в LLM, их связь с чрезмерной уступчивостью и почему корень проблемы в претрейне. Без воды, с шизой.
Читать далее
OpenClaw: Как WhatsApp-хак одного чувака порвал весь GitHub 🫡
Разобрал феномен OpenClaw — как личный WhatsApp-хак стал самым звёздным проектом в истории GitHub за 4 месяца. 250K+ звёзд, конфликт с Anthropic, найм в OpenAI и тёмная сторона хайпа. Без воды, с интерактивными графиками и шизой.
Читать далее
Инференс-движки для LLM: Как перестать гонять модели через transformers и начать жить 🫡
Разбираю инференс-движки для LLM по полочкам — vLLM, SGLang, LMDeploy, Ollama, llama.cpp. Бенчмарки, установка, настройка. Без воды, с кодом и шизой.
Читать далее
Kimi K2.5: Как KimiClaw прогрел рынок на $10 лярд
Разобрал Kimi K2.5 от Moonshot AI — 1T параметров MoE, рой из 100 агентов с 4.5× ускорением и KimiClaw, который за 20 дней сделал больше выручки чем весь 2025 год. Без воды, с шизой.
Читать далее
Qwen3.5: Китайцы сделали модель, которая рвёт GPT-5.2 🫡
Разбираю Qwen3.5 от Alibaba — 397B параметров, 17B активных, MoE, нативное зрение и 201 язык. Как 3B активных параметров побеждают 22B? Разбор с шизой.
Читать далее
От Вайба к Воплощению: Как SKILL-агенты и Вайбклаудинг убивают DevOps 🫡
Разбираю SKILL-ориентированных агентов, вайб-инструменты и Вайбклаудинг — будущее, где человек приносит проблему, а AI строит инфраструктуру. Без воды, с диаграммами и шизой.
Читать далее
Квантизация LLM: Как запихнуть 70B модель в твою видюху 🫡
Разбираю квантизацию LLM по полочкам — от FP32 до INT4, GPTQ, AWQ, GGUF, MoE и практические примеры. Без воды, с кодом и шизой.
Читать далее