
У вас начнётся ШИЗА
AI‑Agents, LLM, ML Inference и ночные сессии с vLLM. Пишу о технологиях, делюсь опытом и шизой.
Свежее
Смотреть все →База — с чего начать
Ещё статьи
Смотреть все →
фундаментРучки сэмплинга: почему temperature=0.7 — это карго-культ 🎛🎲
Что на самом деле делают temperature, top-k, top-p и min-p с распределением вероятностей, в каком порядке они применяются (в vLLM и в HuggingFace он разный), что ставить под код, JSON и творчество — и почему temperature=0 всё равно не даёт детерминизма.
Читать далее
фундаментDiffusion LLM: как генерировать текст не слева-направо 🌫️⚡
Неавторегрессионная генерация текста через итеративный denoising — механика masked-diffusion (LLaDA), почему это ломает KV-кэш и чем отличается от спекулятивного декодинга, игроки (Mercury 2, NVIDIA Nemotron TwoTower) и разбор Celeris-1: заявлено vs независимо измерено.
Читать далее
фундаментПозиционное кодирование: RoPE, YaRN и почему Inkling от них отказался 🎡📐
Зачем трансформеру позиция, как RoPE поворачивает векторы на угол m·θ, почему это относительное кодирование, где оно ломается на длинном контексте и как чинят (NTK, YaRN) — плюс контртезис: Thinking Machines в Inkling выкинула RoPE. С пятью визуальными демками механики.
Читать далее
моделиKimi K3: open-weight модель обгоняет Claude Opus 4.8 🌙⚡
Kimi K3 от Moonshot AI — 2.8T параметров, 104B активных, экстремальная MoE-разреженность и Kimi Delta Attention: тот же гибрид линейного и полного внимания на 3:1, что в пейпере Kimi Linear обещал до 6× ускорения декодинга на длинном контексте.
Читать далее