EvalScope: фреймворк для оценки и бенчмаркинга крупных моделей
EvalScope — это фреймворк для оценки и бенчмаркинга крупных моделей (LLM, VLM, AIGC) с упрощённой настройкой. Он решает задачу проверки производительности и возможностей моделей всего за одну команду, что может быть полезно как исследователям, так и разработчикам.
В отличие от множества других решений, EvalScope фокусируется на легкости использования и расширяемости, позволяя подключать свои модели и API. Это пригодится тем, кто работает с большими языковыми моделями и хочет эффективно проводить тесты. Запуск проекта осуществляется через команду: pip install evalscope, после чего доступно множество возможностей для оценки ваших моделей.
Учти, что проект находится в активной разработке, и в некоторых случаях могут быть ограничения по поддерживаемым API и моделям. Пока что основной упор на Python версии 3.10 и выше.
EvalScope — это универсальная платформа для оценки больших языковых моделей (LLM), разработанная сообществом ModelScope. С её помощью можно легко проводить оценку способностей моделей, тестирование их производительности и визуализацию результатов всего одной командой.
Установка
Для установки EvalScope используй команду:
pip install evalscope
Чтобы получить более детальную информацию о процессе установки, можно обратиться к [содержанию руководства по установке](https://evalscope.readthedocs.io/en/latest/get_started/installation.html).
Основные возможности
- Широкий выбор оценочных benchmarks: Встроенные оценочные benchmarks, такие как MMLU, C-Eval, GSM8K и другие.
- Поддержка многомодальных и многопрофильных моделей: Оценка различных типов моделей, включая LLM, Vision Language Models (VLM), Embedding, ReRanker и AIGC.
- Интеграция с несколькими бэкендами: Бесшовная интеграция с различными оценочными бэкендами, такими как OpenCompass и VLMEvalKit.
- Режим оценки агентов: Проверка разных benchmarks внутри контролируемого многоходового процесса, с возможностью визуализации.
- Тестирование производительности вывода: Мощные инструменты для стресс-тестирования моделей с поддержкой различных метрик.
- Интерактивные отчёты: Веб-дашборд для многомерного сравнения моделей и детального анализа отчетов.
Как запустить проект
После установки, оценку модели можно начать с команды:
evalscope eval --model your-model-name --api-url $OPENAI_API_BASE_URL --api-key $OPENAI_API_KEY --eval-type openai_api --datasets gsm8k --limit 5
Это позволяет оценивать модели, совместимые с OpenAI API, без необходимости использования GPU.
Ограничения
Несмотря на широкий функционал, EvalScope может оказаться сложной для новичков в плане настройки и использования, особенно при работе с кастомными датасетами и сложными конфигациями. Некоторые функции могут требовать дополнительной настройки в зависимости от используемой модели или API.
Дополнительная информация
Для более подробного изучения всех возможностей проекта, его функционала и обновлений, можно ознакомиться с [документацией](https://evalscope.readthedocs.io/en/latest/).
Открыть на GitHub: modelscope/evalscope →
RepoRadar