VLMEvalKit: инструмент для оценки больших мультимодальных моделей
VLMEvalKit — это открытый инструмент для оценки больших мультимодальных моделей (LMMs), поддерживающий более 220 моделей и 80 бенчмарков. Он упрощает процесс тестирования моделей, позволяя запускать оценку с помощью одной команды, без необходимости подготавливать данные из множества репозиториев.
Проект подходит для исследователей и разработчиков, работающих с мультимодальными моделями, особенно если тебе нужно быстро проверить их производительность на различных наборах данных. VLMEvalKit использует генеративный подход к оценке и предоставляет результаты на основе точного соответствия и извлечения ответов с использованием LLM, что является чуть более продвинутым решением по сравнению с традиционными методами.
Код написан на Python, пакет устанавливается с помощью pip. Обрати внимание, что проект активно развивается, и стоит проверить инструкцию по быстрой настройке (quickstart) в README. Также доступны оговорки по использованию, поэтому лучше ознакомиться с документацией.
VLMEvalKit — это инструмент для оценки крупных языковых моделей с визуальным компонентом (LVLMs). Это открытый проект, который упрощает процесс оценки таких моделей, позволяя выполнять оценку одним нажатием кнопки на различных бенчмарках. VLMEvalKit использует метод оценки, основанный на генерации, и предоставляет результаты, полученные с применением как точного совпадения, так и извлечения ответов с помощью LLM (large language model).
Основные возможности
- Упрощенная оценка LVLMs на множестве бенчмарков без необходимости подготовительного этапа с данными.
- Поддержка различных бенчмарков для оценки визуальных и текстовых компонентов.
- Функциональность для работы с моделями, предоставляющими длинные ответы, с сохранением результатов в формате TSV для избежания обрезки данных.
- Интеграция с многоузловым распределенным выводом для ускорения процессов оценки.
Как установить и запустить
Для установки VLMEvalKit необходимо использовать Python пакет:
pip install vlmeval
Для начала работы можно использовать следующий пример кода:
from vlmeval.config import supported_VLM
model = supported_VLM['idefics_9b_instruct']()
# Ввод одного изображения
ret = model.generate(['assets/apple.jpg', 'Что изображено на этом изображении?'])
print(ret) # Изображение представляет собой красное яблоко с листьями.
# Ввод нескольких изображений
ret = model.generate(['assets/apple.jpg', 'assets/apple.jpg', 'Сколько яблок на предоставленных изображениях?'])
print(ret) # На предоставленных изображениях два яблока.
Ограничения
Проект не предназначен для воспроизведения точных значений точности, указанных в оригинальных статьях для сторонних бенчмарков. Это связано с тем, что VLMEvalKit использует метод оценки на основе генерации, в то время как некоторые бенчмарки могут использовать другие методы. Кроме того, все LVLMs тестируются с одинаковыми шаблонами запросов, что может не совпадать с оптимизированными шаблонами для конкретных моделей.
Документация и поддержка
Дополнительную информацию, включая руководство по разработке и настройке, можно найти в [документации](https://github.com/open-compass/VLMEvalKit/docs/en/Quickstart.md). Проект активно поддерживается, и сообщество приветствует вклад от разработчиков, чтобы улучшить функциональность инструмента и добавить новые бенчмарки.
Открыть на GitHub: open-compass/VLMEvalKit →
RepoRadar