Минимальная реализация архитектуры Kimi K3 для запуска на CPU

Появилась минимальная реализация архитектуры нейросети Kimi K3. Она написана на PyTorch и работает на обычных CPU или в Google Colab. Код создан специально для изучения оригинального технического отчета. Все функции и классы содержат прямые ссылки на формулы из документа.
Базовая структура модели полностью сохранена. Реализация включает слои Kimi Delta Attention (KDA), механизм Gated MLA и Attention Residuals. Также под капотом работает блок Stable LatentMoE. Для роутинга экспертов используется стандартный алгоритм top-k, а внутри применяется функция активации SiTU-GLU.
Ради читаемости кода автор пошел на технические упрощения. Модуль KDA реализован через последовательный цикл с вычислительной сложностью O(T). Из архитектуры намеренно убрали низкоранговое сжатие KV-кэша и визуальный энкодер. Это снижает скорость работы на длинных контекстах. Зато подход позволяет построчно разобрать математику слоев внимания без доступа к GPU-кластерам.
Поделиться:
Ещё из архива
Все публикации
Интервью с Владимиром Аюевым: графический язык бигтеха, студия SASHA и дизайн-образование
1 месяц назад
Jockey от TwelveLabs: ИИ-агент для семантического поиска по видеоархивам и извлечения метаданных
1 месяц назад
Архитектура винной этикетки: баланс наборного шрифта и каллиграфии в кейсе Winecraft
1 месяц назад
Оптимизация контекста в Claude Code: как работает кэширование промптов и за что мы платим
1 месяц назад
Архитектура памяти для LLM-агентов: от базового SQLite до Graph RAG
1 месяц назад