VLMEvalKit: инструмент для оценки больших мультимодальных моделей

VLMEvalKit: инструмент для оценки больших мультимодальных моделей

VLMEvalKit — это открытый инструмент для оценки больших мультимодальных моделей (LMMs), поддерживающий более 220 моделей и 80 бенчмарков. Он упрощает процесс тестирования моделей, позволяя запускать оценку с помощью одной команды, без необходимости подготавливать данные из множества репозиториев.

Проект подходит для исследователей и разработчиков, работающих с мультимодальными моделями, особенно если тебе нужно быстро проверить их производительность на различных наборах данных. VLMEvalKit использует генеративный подход к оценке и предоставляет результаты на основе точного соответствия и извлечения ответов с использованием LLM, что является чуть более продвинутым решением по сравнению с традиционными методами.

Код написан на Python, пакет устанавливается с помощью pip. Обрати внимание, что проект активно развивается, и стоит проверить инструкцию по быстрой настройке (quickstart) в README. Также доступны оговорки по использованию, поэтому лучше ознакомиться с документацией.

VLMEvalKit — это инструмент для оценки крупных языковых моделей с визуальным компонентом (LVLMs). Это открытый проект, который упрощает процесс оценки таких моделей, позволяя выполнять оценку одним нажатием кнопки на различных бенчмарках. VLMEvalKit использует метод оценки, основанный на генерации, и предоставляет результаты, полученные с применением как точного совпадения, так и извлечения ответов с помощью LLM (large language model).

Основные возможности

  • Упрощенная оценка LVLMs на множестве бенчмарков без необходимости подготовительного этапа с данными.
  • Поддержка различных бенчмарков для оценки визуальных и текстовых компонентов.
  • Функциональность для работы с моделями, предоставляющими длинные ответы, с сохранением результатов в формате TSV для избежания обрезки данных.
  • Интеграция с многоузловым распределенным выводом для ускорения процессов оценки.

Как установить и запустить

Для установки VLMEvalKit необходимо использовать Python пакет:

pip install vlmeval

Для начала работы можно использовать следующий пример кода:

from vlmeval.config import supported_VLM
model = supported_VLM['idefics_9b_instruct']()
# Ввод одного изображения
ret = model.generate(['assets/apple.jpg', 'Что изображено на этом изображении?'])
print(ret)  # Изображение представляет собой красное яблоко с листьями.
# Ввод нескольких изображений
ret = model.generate(['assets/apple.jpg', 'assets/apple.jpg', 'Сколько яблок на предоставленных изображениях?'])
print(ret)  # На предоставленных изображениях два яблока.

Ограничения

Проект не предназначен для воспроизведения точных значений точности, указанных в оригинальных статьях для сторонних бенчмарков. Это связано с тем, что VLMEvalKit использует метод оценки на основе генерации, в то время как некоторые бенчмарки могут использовать другие методы. Кроме того, все LVLMs тестируются с одинаковыми шаблонами запросов, что может не совпадать с оптимизированными шаблонами для конкретных моделей.

Документация и поддержка

Дополнительную информацию, включая руководство по разработке и настройке, можно найти в [документации](https://github.com/open-compass/VLMEvalKit/docs/en/Quickstart.md). Проект активно поддерживается, и сообщество приветствует вклад от разработчиков, чтобы улучшить функциональность инструмента и добавить новые бенчмарки.

Открыть на GitHub: open-compass/VLMEvalKit →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте