Артемий — автор блога ЭЙ АЙ ШИЗ
Блог Артемия

У вас начнётся ШИЗА

AI‑Agents, LLM, ML Inference и ночные сессии с vLLM. Пишу о технологиях, делюсь опытом и шизой.

База — с чего начать

Ещё статьи

Смотреть все →
Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲фундамент
15 мин

Ручки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲

Что на самом деле делают temperature, top-k, top-p и min-p с распределением вероятностей, в каком порядке они применяются (в vLLM и в HuggingFace он разный), что ставить под код, JSON и творчество — и почему temperature=0 всё равно не даёт детерминизма.

Читать далее
Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡фундамент
7 мин

Diffusion LLM: как генерировать текст не слева-направо 🌫️⚡

Неавторегрессионная генерация текста через итеративный denoising — механика masked-diffusion (LLaDA), почему это ломает KV-кэш и чем отличается от спекулятивного декодинга, игроки (Mercury 2, NVIDIA Nemotron TwoTower) и разбор Celeris-1: заявлено vs независимо измерено.

Читать далее
Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐фундамент
7 мин

Позиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐

Зачем трансформеру позиция, как RoPE поворачивает векторы на угол m·θ, почему это относительное кодирование, где оно ломается на длинном контексте и как чинят (NTK, YaRN) — плюс контртезис: Thinking Machines в Inkling выкинула RoPE. С пятью визуальными демками механики.

Читать далее
Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡модели
14 мин

Kimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡

Kimi K3 от Moonshot AI — 2.8T параметров, 104B активных, экстремальная MoE-разреженность и Kimi Delta Attention: тот же гибрид линейного и полного внимания на 3:1, что в пейпере Kimi Linear обещал до 6× ускорения декодинга на длинном контексте.

Читать далее