Data-Juicer: обработка данных для foundation моделей в AI-приложениях

Data-Juicer: обработка данных для foundation моделей в AI-приложениях

Data-Juicer — это система обработки данных, ориентированная на работу с foundation моделями, позволяющая упрощать процесс подготовки данных для AI-приложений. Она предоставляет возможность трансформировать неструктурированные данные в готовый для анализа формат, что важно в условиях растущей сложности данных в современных проектах.

Данный инструмент отличается от традиционных ETL-процессов тем, что использует модульный подход, позволяя разработчикам комбинировать различные операторы обработки и настраивать их для конкретных задач. Это может быть полезно исследователям и инженерам, работающим с большими объёмами данных, требующих быстрой и гибкой обработки.

Проект написан на Python и доступен через PyPI с командой pip install py-data-juicer. Также доступен Docker-образ для развертывания в контейнерах. Обрати внимание, что проект еще развивается, и возможны ограничения по функционалу и стабильности.

Общая информация о проекте

Data-Juicer — это система обработки данных, созданная для упрощения работы с большими объемами информации в эпоху фондовых моделей. Проект предлагает модульные инструменты для очистки, синтеза и анализа данных в процессе использования искусственного интеллекта. Он подходит как для локальной работы на ноутбуке, так и для масштабирования на тысячи узлов в кластере, исключая необходимость писать промежуточный код.

Ключевые возможности

  • Модульная архитектура: Содержит более 200 операторов для работы с текстовыми, звуковыми и видео данными.
  • Рецепты: Позволяет создавать воспроизводимые YAML-пайплайны, которые можно версионировать и делиться ими.
  • Полноценный анализ данных: Поддерживает предобучение, уточнение и оценку моделей, а также обработку агентских систем.
  • Производительность: Обеспечивает обработку больших объемов данных при высокой скорости и эффективности.

Как установить и запустить

Существует возможность быстро начать работу без установки:

  • Можно воспользоваться [JupyterLab Playground с туториалами](http://8.138.149.181/).
  • Также доступен [DJ Copilot](https://datajuicer.github.io/data-juicer/en/main/docs_index.html) для вопросов.

Если ты хочешь установить и запустить проект, это можно сделать с помощью следующих команд:

pip install py-data-juicer
dj-process --config demos/process_simple/process.yaml

Либо можно использовать Python для составления своих процессов:

from data_juicer.core.data import NestedDataset
from data_juicer.ops.filter import TextLengthFilter
from data_juicer.ops.mapper import WhitespaceNormalizationMapper

ds = NestedDataset.from_dict({
    "text": ["Short", "This passes the filter.", "Text   with   spaces"]
})
res_ds = ds.process([
    TextLengthFilter(min_len=10),
    WhitespaceNormalizationMapper()
])

for s in res_ds:
    print(s)

Ограничения и требования

Несмотря на мощные функции, проект требует наличия ресурсов для обработки больших объемов данных. Например, он может обрабатывать 70 миллиардов образцов за 2 часа на 50 узлах Ray. Производительность также зависит от конфигурации системы и доступных вычислительных ресурсов.

Кроме того, проект активно развивается, и его пользователи могут столкнуться с изменениями в API и функциональности при обновлениях. Рекомендуется следить за обновлениями и документацией.

Открыть на GitHub: datajuicer/data-juicer →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте