Spark NLP: библиотека для обработки естественного языка с поддержкой Spark

Spark NLP — библиотека для обработки естественного языка, построенная на Apache Spark. Она позволяет легко интегрировать эффективные и точные NLP-аннотации в твои машинно-обучающие модели, что особенно важно при работе с большими данными в распределённой среде.

Основная задача Spark NLP — предоставить инструменты для работы с текстом, которые масштабируются и обеспечивают высокую производительность. В отличие от традиционных библиотек, она поддерживает множество предобученных моделей и конвейеров, что значительно упрощает процесс настройки. Если ты работаешь с большими объемами текстовых данных или тебе нужны высокоточные аннотации, этот инструмент может оказаться крайне полезным.

Работа с библиотекой возможна в Scala и Python, запускается она через стандартные инструменты для Apache Spark. Учитывай, что библиотека требует наличия Spark, а также возможны ограничения по платформе — проверяй совместимость с вашей системой.

Общая информация о проекте

Spark NLP — это библиотека для обработки естественного языка (NLP), разработанная на основе Apache Spark. Она позволяет удобно и эффективно выполнять аннотации NLP, что делает её идеальным инструментом для машинного обучения в распределённой среде. Библиотека включает более 100000 предобученных моделей и пайплайнов на более чем 200 языках.

С помощью Spark NLP можно выполнять широкий спектр задач, таких как токенизация, сегментация слов, определение частей речи, векторизация слов и предложений, распознавание именованных сущностей, анализ тональности, перевод текста и многое другое. Это решение подходит как для работы с текстом, так и с изображениями и звуком.

Поддержка моделей

Библиотека обеспечивает легкую интеграцию с моделями из различных популярных фреймворков, включая TensorFlow, ONNX, OpenVINO и Llama.cpp (GGUF). Это позволяет использовать модели из разных источников в твоих рабочих процессах Spark NLP.

Установка и запуск

Для установки Spark NLP потребуется выполнить следующие шаги:

  • Убедись, что у тебя установлен Java (версия 8 или 11 для Apache Spark 3.x, версия 17 для Apache Spark 4.x).
  • Создай новое окружение с помощью Conda:
  • 
    $ conda create -n sparknlp python=3.9 -y
    $ conda activate sparknlp
        
  • Установи соответствующие версии Spark NLP и PySpark:
  • 
    # Apache Spark 3.x (Scala 2.12)
    $ pip install spark-nlp==7.0.0 pyspark==3.5.1
    
    # Apache Spark 4.0.0 (Scala 2.13)
    $ pip install spark-nlp==7.0.0 pyspark==4.0.0
    
    # Apache Spark 4.0.1 и позднее
    $ pip install spark-nlp==7.0.0 pyspark==4.0.1
        
  • Запусти сессию Spark с помощью Spark NLP:
  • 
    spark = sparknlp.start()
        

После этого ты сможешь загружать и использовать предобученные пайплайны, такие как:


pipeline = PretrainedPipeline('explain_document_dl', lang='en')
result = pipeline.annotate(text)
    

Ограничения

Обрати внимание, что поддержка архитектур M1/M2 и AArch64 является экспериментальной. Возможны проблемы совместимости в некоторых средах. Библиотека также подлежит ограничениям по производительности в зависимости от используемого аппаратного обеспечения. Некоторые функции могут не работать в одиночных инсталляциях или требуют доступа к интернету для загрузки моделей и пайплайнов.

Документация и поддержка

Подробную документацию и примеры использования можно найти на официальном сайте проекта: sparknlp.org. Также доступен Slack-канал для обсуждения, GitHub для отслеживания багов и отправки запросов на изменения. Не стесняйся обращаться за помощью или делиться своими идеями!

Открыть на GitHub: JohnSnowLabs/spark-nlp →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте