LMBenchmark: оценка языковых моделей в создании рассказов

LMBenchmark: оценка языковых моделей в создании рассказов

Это бенчмарк для оценки, как хорошо языковые модели (LLM) справляются с созданием коротких рассказов, включающих 10 обязательных элементов сюжета. Он сравнительно анализирует произведения с одинаковыми ограничениями, а также использует оценочные модели для ранжирования написанных рассказов.

Проект будет полезен разработчикам и исследователям в сфере обработки естественного языка, которые хотят иметь представление о сравнительной производительности различных LLM в жанре художественного письма. Бенчмарк уже охватывает 56 моделей и более 15 000 пар рассказов, что позволяет получить важные данные для дальнейшего улучшения алгоритмов.

Технология написана на Python, а запуск осуществляется через стандартные процессы для выполнения бенчмарков. У проекта есть ограничения: результаты могут варьироваться из-за случайных факторов, таких как выбор образцов и моделей оценщиков. Необходимо учитывать, что это исследовательский проект, и его применение в коммерции может быть ограничено.

Проект LLM Creative Story-Writing Benchmark предназначен для оценки способности различных языковых моделей (LLM) к созданию коротких рассказов в соответствии с заранее заданными ограничениями. Цель проекта — сравнить произведения, написанные разными моделями, используя одни и те же креативные задания, и оценить качество написанного с помощью независимых оценщиков.

Как это работает

Оценка происходит следующим образом:

  • Модели генерируют рассказы по заданным требованиям, которые включают десять обязательных элементов: персонажи, объекты, концепции, атрибуты, действия, методы, установки, временные рамки, мотивацию и тон.
  • Каждый рассказ проходит оценку двумя независимыми моделями-оценщиками, которые смотрят на пары рассказов в обоих порядках и выбирают лучший из них.
  • На основании этих оценок рассчитываются относительные баллы для каждой модели.

Установка и запуск

Инструкция по установке не приведена в README, но ты можешь найти истории и подсказки в папках prompts_wc/ и stories_wc//. Данные о текущих оценках и результатах можно найти в data/writing_missing_matchups_20260927/README.md.

Результаты и ограничения

На данный момент проект охватывает 56 языковых моделей и включает 15,043 уникальных пар рассказов, оцененных более чем 101,000 раз. Каждое сравнение включает истории, написанные по одним и тем же требованиям, что позволяет сохранять высокую степень сопоставимости.

Однако важно отметить, что общие оценки не всегда отражают индивидуальные качества рассказов, такие как оригинальность или литературный стиль. Сравнения проводятся по завершенным историям, так что модели с неполными наборами рассказов могут иметь выставленные оценки с ограничениями.

Дополнительные результаты

В проекте также представлены различные метрики, такие как согласие оценщиков, соблюдение пределов по количеству слов и статистические анализы по времени. Для каждой модели есть отчёты о парных сравнениях, которые дают представление о том, как каждая из них справилась с различными задачами.

Заключение

Проект LLM Creative Story-Writing Benchmark предоставляет полезный способ оценить и сравнить творчество разных языковых моделей, помогая исследователям и разработчикам лучше понять их возможности и ограничения. Ты можешь использовать этот инструмент для оценки производительности существующих моделей и исследования их навыков в создании креативного текста.

Открыть на GitHub: lechmazur/writing →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте