Kimi K3: высокопроизводительный вывод модели на одном CPU

Kimi K3 — это модель с 2.78 триллиона параметров, работающая на одном CPU с использованием 8.24 ГБ оперативной памяти. Проект написан на C99 и не требует дополнительных библиотек или фреймворков, что делает его универсальным для запуска на любых машинах, поддерживающих эту архитектуру.

Основная задача — обеспечить высокопроизводительный вывод модели, даже на скромных устройствах. В отличие от многих других решений, которые требуют GPU и сложных библиотек, Kimi K3 позволяет пользователям с ограниченными ресурсами запускать инференс без лишних зависимостей. Это может быть полезно для разработчиков, исследователей и преподавателей, желающих экспериментировать с масштабными языковыми моделями.

Запустить проект можно, следуя инструкциям в README, но стоит помнить, что он предназначен только для Linux на архитектуре x86-64. Обращай внимание на требования и ограничения, если твое окружение другое. Лицензия Apache 2.0 позволяет использование в коммерческих проектах.

Проект Kimi K3 на C

Проект Kimi K3 — это реализация инференса модели с 2.78 триллиона параметров на языке программирования C. Он предназначен для работы на стандартных CPU без использования CUDA или каких-либо специализированных библиотек, таких как BLAS, с минимальными требованиями к памяти и ресурсам. Эта модель может эффективно работать на машинах с всего лишь 8 ГБ ОЗУ.

Зачем этот проект?

Kimi K3 в основном ориентирован на то, чтобы обеспечить возможность использования глубокой языковой модели на стандартных вычислительных ресурсах. Это предоставляет разработчикам, исследователям и энтузиастам возможность интегрировать продвинутые AI-модели в свои приложения без необходимости в дорогостоящих и мощных системах, таких как графические процессоры (GPU) или облачные вычисления.

Установка и запуск

Чтобы установить и запустить проект, следуй следующим инструкциям:

  • Клонируй репозиторий
    git clone https://github.com/FareedKhan-dev/kimi-k3-in-c.git
    cd kimi-k3-in-c
    
  • Собери проект с помощью Makefile:
  • make -j
  • Затем запустите тесты для проверки корректности сборки:
  • make test

Если ты хочешь провести полный запуск, то тебе необходимо скачать 1.56 ТБ чекпоинта модели, следуя указаниям в скрипте:

./scripts/download-model.sh ~/k3model

С последующим созданием упакованного trunk:

./scripts/pack-trunk.sh ~/k3model ~/k3trunk

После чего ты сможешь запускать саму модель:

./bin/k3 ~/k3model --trunk ~/k3trunk --preset laptop --tok ~/k3model --prompt "The capital of France is" --gen 8 --incremental

Что умеет проект?

Проект Kimi K3 позволяет генерировать текст с использованием модели с 2.78 триллионами параметров и обеспечивает:

  • Универсальный интерфейс для работы с любыми короткими текстами: он способен генерировать корректные логические продолжения.
  • Генерацию без использования GPU: проект спроектирован таким образом, чтобы быть полностью независимым от мощных графических процессоров.
  • Оптимизацию памяти: модели очень эффективно используют ОЗУ, позволяя запускать их даже на стандартных машинах с 8 ГБ.
  • Поддержку многоярусной архитектуры: модель может свободно масштабироваться от простых ноутбуков до мощных рабочих станций.

Ограничения

Несмотря на свои достоинства, Kimi K3 имеет некоторые ограничения:

  • Не оптимизирован для работы в реальном времени; время инференса может быть заметным (например, свыше 10 секунд на токен при минимальных настройках).
  • Качество генерируемого текста может варьироваться, особенно под нагрузкой с более обширными контекстами.
  • Зависимость от определённых требований к аппаратным ресурсам, особенно на этапе загрузки большого чекпоинта.

Открыть на GitHub: FareedKhan-dev/kimi-k3-in-c →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться