LLM-TPU: быстрая развертка AI моделей на чипах SOPHGO

LLM-TPU — это проект для быстрой развертки генеративных AI моделей на чипах SOPHGO BM1684X и BM1688. Он упрощает запуск LLM и мультимодальных моделей с помощью одной команды, что экономит время и снижает сложность настройки.

Проект решает задачу интеграции современных AI решений на специализированное оборудование, отличаясь от альтернатив высокой скоростью развертывания и поддержкой нескольких языков. Подходит разработчикам, занимающимся AI и работой с специализированными матрицами, кто хочет использовать уникальные возможности этих чипов.

Для запуска требуется Python версии 3.7 и выше. Учти, что проект ориентирован на определенные платформы и чипы, так что без них не сможешь воспользоваться функционалом. Лицензия Apache 2.0 позволяет использовать LLM-TPU в коммерческих целях.

Проект **LLM-TPU** от компании SOPHGO представляет собой инструмент для деплоя популярных генеративных AI моделей, таких как LLM (Large Language Models) и VLM (Vision Language Models), на чипах TPU серии **BM1684X**, **BM1688** и **CV186X**. Его основное преимущество — возможность быстрого развертывания с помощью одной команды.

С помощью LLM-TPU можно не только исполнять текстовые модели, но и выполнять мультимодальные задачи, такие как обработка изображений и видео. Проект охватывает множество моделей, включая Qwen, Llama, DeepSeek и многие другие.

Установка и запуск

Чтобы запустить LLM на TPU, достаточно выполнить следующие шаги:

git clone https://github.com/sophgo/LLM-TPU.git
cd LLM-TPU
./run.sh --model qwen3.5

Модели, которые можно запустить одной командой:

  • ./run.sh --model qwen3 — для модели Qwen3-4B
  • ./run.sh --model qwen3.5 — для модели Qwen3.5-2B
  • ./run.sh --model internvl3 — для модели InternVL3-2B

Обратите внимание, что для компиляции моделей требуется установленная среда **TPU-MLIR**, которую можно настроить как через Docker, так и собрав из исходников.

Поддерживаемые модели

LLM-TPU поддерживает множество моделей для текстовых и мультимодальных задач. Некоторые из них включают:

  • Модели LLM: Qwen, DeepSeek, Llama, MiniCPM и ChatGLM.
  • Мультимодальные модели: Mage-VL, Qwen3-TTS, Falcon-Perception и Gemma4.

Каждая модель может иметь свои уникальные возможности, и для некоторых из них имеется предкомпилированный bmodel для быстрого старта.

Особенности

LLM-TPU предлагает несколько ключевых возможностей:

  • Динамическая компиляция, что уменьшает задержки при коротких запросах.
  • Поддержка KV Cache для многопроцессных разговоров, что значительно улучшает производительность.
  • Параллельное исполнение на нескольких TPU для увеличения пропускной способности.
  • Версия моделей на Python и C++ для гибкости разработки.

Ограничения

Хоть проект и поддерживает множество моделей, важно учитывать, что:

  • Компиляция моделей может потребовать времени и ресурсов в зависимости от их размера и сложности.
  • Для некоторых задач могут потребоваться предобработанные веса моделей, и не все модели могут быть доступны для компиляции на всех поддерживаемых чипах.
  • Некоторые старые версии моделей находятся в разделе "не поддерживаются" и могут быть недоступны для дальнейшего использования.

В целом, LLM-TPU предлагает мощное и гибкое решение для работы с современными AI моделями на TPUs от SOPHGO, что позволяет разработчикам ускорить процесс внедрения и использования AI технологий.

Открыть на GitHub: sophgo/LLM-TPU →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте