ms-swift: инфраструктура для настройки LLM и MLLM с PEFT
ms-swift — это инфраструктура для настройки LLM и MLLM с использованием PEFT или полных параметров. Она позволяет эффективно работать с более чем 600 LLM (например, Qwen3.6, Llama4) и 300 MLLM (включая Qwen3-VL, Phi4), что может быть полезно для разработчиков, занимающихся обучением или тонкой настройкой современных моделей.
Проект выделяется между аналогами удобством интеграции с существующими моделями и поддержкой множества архитектур. Благодаря этому, тебе не придется начинать с нуля — можно быстро адаптировать и тестировать различные модели в рамках единой системы. Поддерживаются Python 3.12 и PyTorch версии 2.0 и выше. Для начала работы, следуй инструкциям в документации по установке и использованию.
Имей в виду, что проект на данный момент является стадией разработки, поэтому возможны не все функции или оптимизация, которые ты ожидаешь. Кроме того, актуальный уровень поддержки и сообщество можно проверить через Discord или документацию.
Что такое ms-swift?
ms-swift — это фреймворк для дообучения и развертывания крупных моделей и мультимодальных моделей, предоставленный сообществом ModelScope. Он поддерживает обучение (предварительное обучение, дообучение, согласование с человеком), инференс, оценку, квантизацию и развертывание более 600 текстовых моделей и 400 мультимодальных моделей. В числе поддерживаемых моделей — Qwen3, InternLM3 и множество других.
Для чего нужен ms-swift?
Платформа ms-swift предназначена для упрощения и ускорения процесса обучения и развертывания высококачественных языковых и мультимодальных моделей. Она интегрирует новейшие технологии обучения, включая методы параллелизма Megatron и алгоритмы обучения с подкреплением GRPO. Этот фреймворк предоставляет пользователям удобные инструменты для выполнения различных задач, связанных с обучением и инференсом, тем самым улучшая производительность и ускоряя скорость разработки.
Как установить и запустить?
Установка ms-swift осуществляется с помощью команды pip:
pip install ms-swift -U
Если ты хочешь установить фреймворк из исходников, используй следующие команды:
git clone https://github.com/modelscope/ms-swift.git
cd ms-swift
pip install -e .
Также возможна установка с использованием uv:
uv pip install ms-swift -U --torch-backend=auto
Для работы требуется определённая среда, желательно использовать Python версии 3.12, а также PyTorch версии не ниже 2.0 и другие зависимости. Подробную информацию о необходимых версиях можно найти в README.
Как быстро начать пользоваться?
Чтобы начать обучение модели Qwen3-4B-Instruct-2507 на GPU 3090, можно использовать следующий пример команды:
CUDA_VISIBLE_DEVICES=0 \
swift sft \
--model Qwen/Qwen3-4B-Instruct-2507 \
--tuner_type lora \
--dataset 'AI-ModelScope/alpaca-gpt4-data-zh#500' \
'AI-ModelScope/alpaca-gpt4-data-en#500' \
'swift/self-cognition#500' \
--torch_dtype bfloat16 \
--num_train_epochs 1 \
--per_device_train_batch_size 1 \
--output_dir output
После завершения обучения для инференса можно использовать:
CUDA_VISIBLE_DEVICES=0 \
swift infer \
--adapters output/vx-xxx/checkpoint-xxx \
--stream true
Для использования веб-интерфейса просто введи команду:
SWIFT_UI_LANG=en swift web-ui
Ограничения
Хотя ms-swift поддерживает широкий спектр моделей и технологий, существуют некоторые ограничения. Например, для успешной работы потребуется достаточное количество вычислительных ресурсов (GPU), а также корректная настройка окружения и зависимостей. Поддержка различных типов моделей может варьироваться, и некоторые функции могут иметь специфические требования к аппаратному обеспечению или программному обеспечению.
В случае использования нестандартных моделей или датасетов может потребоваться дополнительная настройка и адаптация параметров обучения для успешного завершения процесса.
Открыть на GitHub: modelscope/ms-swift →
RepoRadar