MaxText: библиотека для создания масштабируемых LLM на Python
MaxText — это высокопроизводительная библиотека для построения масштабируемых моделей больших языковых моделей (LLM), написанная на Python с использованием JAX.
Проект предназначен для тех, кто хочет разрабатывать и обучать LLM, используя мощности Google Cloud TPUs и GPUs. MaxText предлагает разнообразные модели, такие как Gemma и Llama, и поддерживает как предобучение, так и постобучение. В отличие от других библиотек, MaxText фокусируется на максимальной производительности и простоте использования, обеспечивая разработчикам возможность работы с мощными ML-инструментами без лишних сложностей.
Для запуска библиотеки потребуется Python 3.12, так как эта версия является основной поддерживаемой. Важно учесть, что main ветка проекта еще не готова к производственному использованию, так что для стабильной работы лучше использовать последний релиз из PyPI или готовые контейнерные образы.
MaxText — это высокопроизводительная библиотека LLM (Large Language Models) с открытым исходным кодом, написанная на Python с использованием JAX, ориентированная на обучение на Google Cloud TPUs и GPUs. Она предоставляет библиотеку высокопроизводительных моделей, таких как Gemma, Llama, DeepSeek, Qwen и Mistral, и поддерживает предобучение и настройку моделей с использованием популярных техник, включая Supervised Fine-Tuning (SFT) и различные методы оптимизации.
Проект предлагает удобную платформу как для исследовательских, так и для производственных LLM-проектов. Можно начать с экспериментирования с MaxText, а затем форкать и модифицировать библиотеку в соответствии со своими потребностями.
Установка
Рекомендуется установить MaxText через pip из PyPI. Для этого следуй инструкциям в [руководстве по установке](https://maxtext.readthedocs.io/en/latest/install_maxtext.html#from-pypi-recommended).
Функциональность
MaxText поддерживает как предобучение, так и последующее обучение. Если ты собираешься строить модели с нуля, библиотека может служить ориентиром для экспериментов и идей. Кроме того, MaxText предлагает масштабируемую архитектуру для последующего обучения моделей, включая проприетарные или открытые. Это позволяет легко исследовать различные комбинации моделей и техник для оптимизации обучения.
- Предобучение: MaxText предоставляет реализацию, которая позволяет исследовать различные конфигурации и архитектуры моделей, от небольших (например, Llama 8B) до больших (например, DeepSeek-V3).
- Последующее обучение: MaxText позволяет реализовать обучение с подкреплением и другие методы настройки, используя инфраструктуру активности с помощью Tunix.
Модели
MaxText предоставляет поддержку множества моделей от различных компаний, включая Google, Alibaba, DeepSeek, Moonshot, Meta и OpenAI. Все эти модели предназначены как для простых текстовых LLM, так и для многомодальных моделей, таких как Gemma и Llama.
Ограничения
Хотя проект активно развивается, рекомендуется использовать последнюю стабильную версию из PyPI, так как главная ветка может не быть готова к производственному использованию. MaxText лучше всего работает с Python версии 3.12, и использование иных версий может привести к проблемам совместимости.
Если возникает необходимость в обсуждении или обратной связи, присоединяйся к [дискорд-каналу](https://discord.com/invite/2H9PhvTcDU).
Открыть на GitHub: AI-Hypercomputer/maxtext →
RepoRadar