LLM-TPU: быстрая развертка AI моделей на чипах SOPHGO
LLM-TPU — это проект для быстрой развертки генеративных AI моделей на чипах SOPHGO BM1684X и BM1688. Он упрощает запуск LLM и мультимодальных моделей с помощью одной команды, что экономит время и снижает сложность настройки.
Проект решает задачу интеграции современных AI решений на специализированное оборудование, отличаясь от альтернатив высокой скоростью развертывания и поддержкой нескольких языков. Подходит разработчикам, занимающимся AI и работой с специализированными матрицами, кто хочет использовать уникальные возможности этих чипов.
Для запуска требуется Python версии 3.7 и выше. Учти, что проект ориентирован на определенные платформы и чипы, так что без них не сможешь воспользоваться функционалом. Лицензия Apache 2.0 позволяет использовать LLM-TPU в коммерческих целях.
Проект **LLM-TPU** от компании SOPHGO представляет собой инструмент для деплоя популярных генеративных AI моделей, таких как LLM (Large Language Models) и VLM (Vision Language Models), на чипах TPU серии **BM1684X**, **BM1688** и **CV186X**. Его основное преимущество — возможность быстрого развертывания с помощью одной команды.
С помощью LLM-TPU можно не только исполнять текстовые модели, но и выполнять мультимодальные задачи, такие как обработка изображений и видео. Проект охватывает множество моделей, включая Qwen, Llama, DeepSeek и многие другие.
Установка и запуск
Чтобы запустить LLM на TPU, достаточно выполнить следующие шаги:
git clone https://github.com/sophgo/LLM-TPU.git
cd LLM-TPU
./run.sh --model qwen3.5
Модели, которые можно запустить одной командой:
./run.sh --model qwen3— для модели Qwen3-4B./run.sh --model qwen3.5— для модели Qwen3.5-2B./run.sh --model internvl3— для модели InternVL3-2B
Обратите внимание, что для компиляции моделей требуется установленная среда **TPU-MLIR**, которую можно настроить как через Docker, так и собрав из исходников.
Поддерживаемые модели
LLM-TPU поддерживает множество моделей для текстовых и мультимодальных задач. Некоторые из них включают:
- Модели LLM: Qwen, DeepSeek, Llama, MiniCPM и ChatGLM.
- Мультимодальные модели: Mage-VL, Qwen3-TTS, Falcon-Perception и Gemma4.
Каждая модель может иметь свои уникальные возможности, и для некоторых из них имеется предкомпилированный bmodel для быстрого старта.
Особенности
LLM-TPU предлагает несколько ключевых возможностей:
- Динамическая компиляция, что уменьшает задержки при коротких запросах.
- Поддержка KV Cache для многопроцессных разговоров, что значительно улучшает производительность.
- Параллельное исполнение на нескольких TPU для увеличения пропускной способности.
- Версия моделей на Python и C++ для гибкости разработки.
Ограничения
Хоть проект и поддерживает множество моделей, важно учитывать, что:
- Компиляция моделей может потребовать времени и ресурсов в зависимости от их размера и сложности.
- Для некоторых задач могут потребоваться предобработанные веса моделей, и не все модели могут быть доступны для компиляции на всех поддерживаемых чипах.
- Некоторые старые версии моделей находятся в разделе "не поддерживаются" и могут быть недоступны для дальнейшего использования.
В целом, LLM-TPU предлагает мощное и гибкое решение для работы с современными AI моделями на TPUs от SOPHGO, что позволяет разработчикам ускорить процесс внедрения и использования AI технологий.
Открыть на GitHub: sophgo/LLM-TPU →
RepoRadar