
У вас начнётся ШИЗА
AI‑Agents, LLM, ML Inference и ночные сессии с vLLM. Пишу о технологиях, делюсь опытом и шизой.
Последние статьи
Смотреть все →
НовоеGuardrails LLM Filter: чтобы твои секреты не уехали к LLM-провайдеру 🛡️🔑
Разбираю cloud-ru-tech/guardrails-llm-filter — открытый прокси, который маскирует PII и секреты по пути к LLM и возвращает оригиналы в ответе. Запустил демо, погонял карты, СНИЛС и ключи от AWS, прошёлся по всей веб-консоли: правила, песочница, теневой режим, аудит, мониторинг.
Читать далее
KV-кэш: почему LLM помнит без памяти и жрёт VRAM как не в себя 🧠💾
KV-кэш простыми словами: зачем он нужен, почему без него генерация была бы в разы медленнее, и почему именно из-за него у тебя OOM на длинном контексте. С интерактивом и калькулятором VRAM.
Читать далееNVIDIA Dynamo: дирижёр для инференса на целый дата-центр 🎻🖥️
Разбираю ai-dynamo/dynamo — открытый оркестратор инференса от NVIDIA. Зачем нужен, как устроен (KV-aware роутинг, disaggregated prefill/decode, KVBM, Planner), как обрабатывается запрос и как запустить. С mermaid-диаграммами и интерактивом.
Читать далееUnlimited-OCR от Baidu: OCR, который читает страницу как картинку 📄👁️
Разбираю baidu/Unlimited-OCR — 3B vision-language модель для распознавания документов в духе DeepSeek-OCR. Как работает оптическое сжатие, что умеет, режимы gundam/base, и как запустить через transformers и SGLang. С интерактивом.
Читать далее
Харнес агента: Что превращает тупую LLM в автономного работягу 🫡
Разбираю, что такое харнес агента — обвязка вокруг LLM, которая делает из генератора текста рабочую лошадку: цикл, вызов инструментов, контекст, песочница. Как жили без него и минимальный харнес на 20 строк Python. Без воды, с кодом и шизой.
Читать далее