mlx-serve: сервер для локального запуска языковых моделей на macOS
mlx-serve — это сервер для локального запуска языковых моделей на Apple Silicon. Он позволяет работать с моделями в форматах MLX и GGUF и предоставляет совместимые с API OpenAI и Anthropic интерфейсы, что облегчает интеграцию в существующие приложения.
Основное преимущество mlx-serve — полная локальность без необходимости в Python, облаке или Electron. Это решение подойдет разработчикам, которым нужна высокая производительность для работы с AI на своих Mac без зависимости от сторонних сервисов. Кроме того, в проект включено приложение MLX Core для macOS с возможностями чата, режимом агентов и вызовом инструментов.
Проект пока ориентирован только на платформу macOS и использует язык Zig. Можно скачать приложение с последними релизами и запустить сервер командой из терминала. Учти, что проект находится на ранней стадии, так что возможны нестабильности.
Проект **mlx-serve** предназначен для запуска различных языковых моделей (LLM) на устройствах Apple Silicon, предлагая локальные вычисления без необходимости установки Python или использования облачных сервисов. Это приложение разработано на языке Zig и поддерживает как модели в формате MLX, так и GGUF с HuggingFace, включая такие популярные модели, как Qwen, Llama и другие. Проект предлагает совместимые HTTP API для взаимодействия с OpenAI и Anthropic, что позволяет применять его в различных приложениях и инструментах, которые поддерживают данные API.
Установка и запуск
Чтобы начать работу с mlx-serve, тебе потребуется macOS версии 26.2 и выше на устройствах Apple Silicon. Существует несколько способов установки:
- Использование приложения (рекомендуется). Скачай MLX Core.app, которое представляет собой завернутый в меню приложение для macOS. В нем можно загружать модели, общаться с чат-агентом, управлять инструментами MCP и генерировать различные медиа.
- Установка через Homebrew. Выполни команды:
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve brew install --cask mlx-core # приложение (рекомендуется) brew install mlx-serve # только CLI + сервер, без GUI - Запуск в терминале. Если предпочитаешь терминал, можешь использовать команды, например:
mlx-serve run gemma4 # загрузка и запуск модели Gemma 4 mlx-serve list # просмотр загруженных моделей
Функциональные возможности
mlx-serve поддерживает множество функций, включая:
- Генерация текстов, изображений, видео, музыки, речевых сообщений и 3D моделей.
- Совместимость с API OpenAI и Anthropic, а также Ollama API для интеграции с различными кодировщиками и инструментами.
- Поддержка LAN-моделей - возможность делиться моделями между разными Mac в локальной сети без настройки.
- Управление моделями и генерация медиа через простые команды в интерфейсе приложения или CLI.
- Изолированное выполнение команд в agent sandbox для безопасного тестирования моделей.
Ограничения
Хотя mlx-serve предлагает множество возможностей, существуют некоторые ограничения:
- Программное обеспечение совместимо только с Apple Silicon и требует macOS версии 26.2 и выше.
- Отсутствие поддержки некоторых объектов/свойств, которые могут быть доступны в других проектах, таких как Ollama или LM Studio.
- Некоторые модели могут требовать значительное количество оперативной памяти, особенно для более сложных задач, таких как генерация видео или 3D моделей.
Документация и поддержка
Проект имеет обширную документацию, где ты можешь найти информацию о командах CLI, доступных API, интеграциях с другими инструментами и поддерживаемых моделях. Если у тебя возникнут вопросы, большинство распространенных подготовленных ответов можно найти в часто задаваемых вопросах.
Таким образом, mlx-serve — это мощное решение для пользователей macOS, которым необходимо выполнение LLM локально на своих устройствах, с поддержкой множества функций и легкостью интеграции с существующими инструментами.
Открыть на GitHub: ddalcu/mlx-serve →
RepoRadar