Kimi K3: высокопроизводительный вывод модели на одном CPU
Kimi K3 — это модель с 2.78 триллиона параметров, работающая на одном CPU с использованием 8.24 ГБ оперативной памяти. Проект написан на C99 и не требует дополнительных библиотек или фреймворков, что делает его универсальным для запуска на любых машинах, поддерживающих эту архитектуру.
Основная задача — обеспечить высокопроизводительный вывод модели, даже на скромных устройствах. В отличие от многих других решений, которые требуют GPU и сложных библиотек, Kimi K3 позволяет пользователям с ограниченными ресурсами запускать инференс без лишних зависимостей. Это может быть полезно для разработчиков, исследователей и преподавателей, желающих экспериментировать с масштабными языковыми моделями.
Запустить проект можно, следуя инструкциям в README, но стоит помнить, что он предназначен только для Linux на архитектуре x86-64. Обращай внимание на требования и ограничения, если твое окружение другое. Лицензия Apache 2.0 позволяет использование в коммерческих проектах.
Проект Kimi K3 на C
Проект Kimi K3 — это реализация инференса модели с 2.78 триллиона параметров на языке программирования C. Он предназначен для работы на стандартных CPU без использования CUDA или каких-либо специализированных библиотек, таких как BLAS, с минимальными требованиями к памяти и ресурсам. Эта модель может эффективно работать на машинах с всего лишь 8 ГБ ОЗУ.
Зачем этот проект?
Kimi K3 в основном ориентирован на то, чтобы обеспечить возможность использования глубокой языковой модели на стандартных вычислительных ресурсах. Это предоставляет разработчикам, исследователям и энтузиастам возможность интегрировать продвинутые AI-модели в свои приложения без необходимости в дорогостоящих и мощных системах, таких как графические процессоры (GPU) или облачные вычисления.
Установка и запуск
Чтобы установить и запустить проект, следуй следующим инструкциям:
- Клонируй репозиторий
git clone https://github.com/FareedKhan-dev/kimi-k3-in-c.git cd kimi-k3-in-c- Собери проект с помощью Makefile:
make -j- Затем запустите тесты для проверки корректности сборки:
make test
Если ты хочешь провести полный запуск, то тебе необходимо скачать 1.56 ТБ чекпоинта модели, следуя указаниям в скрипте:
./scripts/download-model.sh ~/k3model
С последующим созданием упакованного trunk:
./scripts/pack-trunk.sh ~/k3model ~/k3trunk
После чего ты сможешь запускать саму модель:
./bin/k3 ~/k3model --trunk ~/k3trunk --preset laptop --tok ~/k3model --prompt "The capital of France is" --gen 8 --incremental
Что умеет проект?
Проект Kimi K3 позволяет генерировать текст с использованием модели с 2.78 триллионами параметров и обеспечивает:
- Универсальный интерфейс для работы с любыми короткими текстами: он способен генерировать корректные логические продолжения.
- Генерацию без использования GPU: проект спроектирован таким образом, чтобы быть полностью независимым от мощных графических процессоров.
- Оптимизацию памяти: модели очень эффективно используют ОЗУ, позволяя запускать их даже на стандартных машинах с 8 ГБ.
- Поддержку многоярусной архитектуры: модель может свободно масштабироваться от простых ноутбуков до мощных рабочих станций.
Ограничения
Несмотря на свои достоинства, Kimi K3 имеет некоторые ограничения:
- Не оптимизирован для работы в реальном времени; время инференса может быть заметным (например, свыше 10 секунд на токен при минимальных настройках).
- Качество генерируемого текста может варьироваться, особенно под нагрузкой с более обширными контекстами.
- Зависимость от определённых требований к аппаратным ресурсам, особенно на этапе загрузки большого чекпоинта.
Открыть на GitHub: FareedKhan-dev/kimi-k3-in-c →
RepoRadar