Data-Juicer: обработка данных для foundation моделей в AI-приложениях
Data-Juicer — это система обработки данных, ориентированная на работу с foundation моделями, позволяющая упрощать процесс подготовки данных для AI-приложений. Она предоставляет возможность трансформировать неструктурированные данные в готовый для анализа формат, что важно в условиях растущей сложности данных в современных проектах.
Данный инструмент отличается от традиционных ETL-процессов тем, что использует модульный подход, позволяя разработчикам комбинировать различные операторы обработки и настраивать их для конкретных задач. Это может быть полезно исследователям и инженерам, работающим с большими объёмами данных, требующих быстрой и гибкой обработки.
Проект написан на Python и доступен через PyPI с командой pip install py-data-juicer. Также доступен Docker-образ для развертывания в контейнерах. Обрати внимание, что проект еще развивается, и возможны ограничения по функционалу и стабильности.
Общая информация о проекте
Data-Juicer — это система обработки данных, созданная для упрощения работы с большими объемами информации в эпоху фондовых моделей. Проект предлагает модульные инструменты для очистки, синтеза и анализа данных в процессе использования искусственного интеллекта. Он подходит как для локальной работы на ноутбуке, так и для масштабирования на тысячи узлов в кластере, исключая необходимость писать промежуточный код.
Ключевые возможности
- Модульная архитектура: Содержит более 200 операторов для работы с текстовыми, звуковыми и видео данными.
- Рецепты: Позволяет создавать воспроизводимые YAML-пайплайны, которые можно версионировать и делиться ими.
- Полноценный анализ данных: Поддерживает предобучение, уточнение и оценку моделей, а также обработку агентских систем.
- Производительность: Обеспечивает обработку больших объемов данных при высокой скорости и эффективности.
Как установить и запустить
Существует возможность быстро начать работу без установки:
- Можно воспользоваться [JupyterLab Playground с туториалами](http://8.138.149.181/).
- Также доступен [DJ Copilot](https://datajuicer.github.io/data-juicer/en/main/docs_index.html) для вопросов.
Если ты хочешь установить и запустить проект, это можно сделать с помощью следующих команд:
pip install py-data-juicer
dj-process --config demos/process_simple/process.yaml
Либо можно использовать Python для составления своих процессов:
from data_juicer.core.data import NestedDataset
from data_juicer.ops.filter import TextLengthFilter
from data_juicer.ops.mapper import WhitespaceNormalizationMapper
ds = NestedDataset.from_dict({
"text": ["Short", "This passes the filter.", "Text with spaces"]
})
res_ds = ds.process([
TextLengthFilter(min_len=10),
WhitespaceNormalizationMapper()
])
for s in res_ds:
print(s)
Ограничения и требования
Несмотря на мощные функции, проект требует наличия ресурсов для обработки больших объемов данных. Например, он может обрабатывать 70 миллиардов образцов за 2 часа на 50 узлах Ray. Производительность также зависит от конфигурации системы и доступных вычислительных ресурсов.
Кроме того, проект активно развивается, и его пользователи могут столкнуться с изменениями в API и функциональности при обновлениях. Рекомендуется следить за обновлениями и документацией.
Открыть на GitHub: datajuicer/data-juicer →
RepoRadar