Артемий — автор блога ЭЙ АЙ ШИЗ
Блог Артемия

У вас начнётся ШИЗА

AI‑Agents, LLM, ML Inference и ночные сессии с vLLM. Пишу о технологиях, делюсь опытом и шизой.

Последние статьи

Смотреть все →
Guardrails LLM Filter: чтобы твои секреты не уехали к LLM-провайдеру 🛡️🔑Новое
10 мин

Guardrails LLM Filter: чтобы твои секреты не уехали к LLM-провайдеру 🛡️🔑

Разбираю cloud-ru-tech/guardrails-llm-filter — открытый прокси, который маскирует PII и секреты по пути к LLM и возвращает оригиналы в ответе. Запустил демо, погонял карты, СНИЛС и ключи от AWS, прошёлся по всей веб-консоли: правила, песочница, теневой режим, аудит, мониторинг.

Читать далее
KV-кэш: почему LLM помнит без памяти и жрёт VRAM как не в себя 🧠💾
7 мин

KV-кэш: почему LLM помнит без памяти и жрёт VRAM как не в себя 🧠💾

KV-кэш простыми словами: зачем он нужен, почему без него генерация была бы в разы медленнее, и почему именно из-за него у тебя OOM на длинном контексте. С интерактивом и калькулятором VRAM.

Читать далее
7 мин

NVIDIA Dynamo: дирижёр для инференса на целый дата-центр 🎻🖥️

Разбираю ai-dynamo/dynamo — открытый оркестратор инференса от NVIDIA. Зачем нужен, как устроен (KV-aware роутинг, disaggregated prefill/decode, KVBM, Planner), как обрабатывается запрос и как запустить. С mermaid-диаграммами и интерактивом.

Читать далее
5 мин

Unlimited-OCR от Baidu: OCR, который читает страницу как картинку 📄👁️

Разбираю baidu/Unlimited-OCR — 3B vision-language модель для распознавания документов в духе DeepSeek-OCR. Как работает оптическое сжатие, что умеет, режимы gundam/base, и как запустить через transformers и SGLang. С интерактивом.

Читать далее
Харнес агента: Что превращает тупую LLM в автономного работягу 🫡
9 мин

Харнес агента: Что превращает тупую LLM в автономного работягу 🫡

Разбираю, что такое харнес агента — обвязка вокруг LLM, которая делает из генератора текста рабочую лошадку: цикл, вызов инструментов, контекст, песочница. Как жили без него и минимальный харнес на 20 строк Python. Без воды, с кодом и шизой.

Читать далее