Kitaru: инструмент для записи и воспроизведения сессий AI-агентов
Kitaru — это инструмент для записи и воспроизведения сессий AI-агентов, позволяющий проверять изменения в моделях и коде перед развертыванием. Он решает проблему тестирования на основе реальных данных, используя историю работы агентов, чтобы выявлять улучшения и регрессии.
В отличие от традиционных подходов, которые только анализируют traces, Kitaru позволяет их запускать, что дает более детальное понимание, как изменения влияют на производительность системы. Это может быть полезно как разработчикам, так и исследователям, работающим с AI и ML, предлагая способ более эффективно управлять качеством моделей.
Проект написан на Python и TypeScript, доступен для самохостинга. Для начала работы рекомендуется посмотреть документацию или ознакомиться с руководством на сайте ZenML. Помни, что Kitaru находится на ранней стадии разработки, так что имей в виду возможные баги и недоработки.
Проект Kitaru (来る, "прибывать") предназначен для работы с AI-агентами и предлагает возможность проводить оценку производительности на основе перезаписи данных. Он позволяет записывать или импортировать выполненные сессии, повторно воспроизводить их с использованием следующей версии модели, измененного запроса или обновленного кода, чтобы определить, что улучшилось, а что стало хуже до момента развертывания. Это проект с открытым исходным кодом, который можно развернуть на своих серверах, и он написан на Python и TypeScript.
Зачем нужны такие возможности?
Kitaru помогает использовать уже существующие данные о работе AI-агентов, сохранившемся в виде трасс, и превращает их в инструмент для тестирования. Ключевые возможности проекта включают:
- Каждое выполнение становится сессией. Можно обернуть агента один раз или импортировать существующие трассы из других систем, таких как Langfuse, LangSmith и MLflow.
- Воспроизведение повторно выполняет код. Настоящий агент запускается заново, используя данные из записи, что позволяет точно оценить изменение результатов.
- Оценка начинается с человеческого мнения. Агент, помогающий пользователю, просматривает важные сессии, задает вопросы и фиксирует ответы для дальнейшего анализа.
Как установить и запустить Kitaru?
Для начала работы с Kitaru следуй этим шагам:
- Установка. Открой терминал в папке с твоим проектом и запусти команду:
- Для ручной установки добавь Kitaru в среду проекта, после чего выбери либо управляемый облачный сервер, либо локальный сервер на Docker или Podman:
- Настрой своего агента. Убедись, что у твоего кодового помощника есть все необходимые навыки. Запусти команду:
- Получай агента с трассами. Наиболее быстрый способ — использовать готового агента PydanticAI с проверенной трассой:
- Запусти процесс оценки. Используй команду, чтобы провести исследование с использованием имеющихся данных:
curl -fsSL https://kitaru.ai/install | bash
uv add "kitaru[cli,worker,mcp]" kitaru-pydantic-ai
uv run kitaru login
uv run kitaru login --local
uv run kitaru setup
git clone https://github.com/zenml-io/kitaru.git
cd kitaru/examples/python/pydantic_ai_ticket_resolver
Use kitaru-investigation to investigate this agent and help me test one meaningful improvement.
Ограничения и особенности
Kitaru проектируется как самохостинговое решение. Это значит, что сервер работает на твоей инфраструктуре, и все операции (воспроизведение, импорт и оценка) происходят в защищенной среде твоей системы. Необходимо учитывать:
- Трафик и данные не покидают твою среду.
- В отсутствии обязательного облачного управления, скорость развертывания и использования зависит от конфигурации твоего сервера.
Фреймворки и языки, поддерживаемые Kitaru, включают Python и TypeScript, предлагая адаптеры для различных систем, что делает интеграцию гибкой и масштабируемой.
С помощью Kitaru ты можешь эффективно управлять тестированием и оценкой AI-агентов, а весь процесс сосредоточен на предпочтениях и потребностях твоего проекта.
Открыть на GitHub: zenml-io/kitaru →
RepoRadar