AgentMeasure: аудит работы AI-агентов и анализ логов

AgentMeasure: аудит работы AI-агентов и анализ логов

AgentMeasure — это инфраструктура для измерения работы AI-агентов, помогающая находить ошибки в выставлении счетов и оценивать стабильность их работы. Проект предоставляет средства для анализа логов с Codex и Claude, выявляя повторяющиеся сбои и ошибки.

Основная задача AgentMeasure — это аудит взаимодействий с AI-агентами, выявление и устранение ошибок в ведении логов и учете токенов. Это решение отличается от других инструментов тем, что анализ выполняется локально без сетевых запросов, что упрощает использование и повышает безопасность. Проект может быть особенно полезен для разработчиков, работающих с AI-системами, которые хотят улучшить свои процессы учета и минимизировать ошибки в биллинге.

Запустить AgentMeasure можно с помощью Python 3.9 и выше, установив его через pipx. Обрати внимание, что требуется локальная настройка и нет возможности использования в сети. Проект активно разрабатывается, но возможны ограничения в функционале на ранних стадиях.

AgentMeasure — это проект, который позволяет находить повторяющиеся ошибки и попытки повторного выполнения в сессиях Codex и Claude Code. Он анализирует существующие логи развертывания Codex и логи сессий Claude, создавая сводки и HTML-отчёты. Проект ищет дублирующиеся записи, цепочки повторных попыток и последовательные сбои инструментов, а также проводит проверки для уверенности в полном покрытии операций и стабильности токенов.

Зачем нужен AgentMeasure

AgentMeasure создаёт стандарт для измерения использования возможностей AI-агентов и их результатов. Он разделяет факты выполнения и логические операции, предоставляя информацию о том, что действительно произошло и за что осуществляется оплата. Инструмент пригоден для проверки соответствия декларируемым правилам и проведения аудита, не требуя от пользователя отправки данных в облако.

Как установить и запустить

AgentMeasure доступен в виде пакета Python на PyPI, начиная с версии 0.4.0. Установку можно выполнить с помощью pipx. Вот основные команды для работы с инструментом:

pipx run agentmeasure demo
pipx run agentmeasure check
pipx run agentmeasure check --runtime claude

Первая команда запускает демонстрационный пример, вторая проверяет локальные сессии за последние 7 дней, а третья принудительно использует адаптер Claude Code.

Что умеет AgentMeasure

Проект реализует локальный анализ без сетевых вызовов и предоставляет следующие функции:

  • Анализ завершений операций и повторных попыток;
  • Возможность генерации отчетов в HTML-формате;
  • Проверки на соответствие для телеметрии AI-агентов;
  • Отчёты о расходах и итоговые заявления для углубленного анализа.

Ограничения

AgentMeasure не является платёжным протоколом, рынком или универсальной системой рейтингов. Это инструмент для стандартизации фактической информации и семантики измерений, на основе которых могут строиться другие системы. Разумеется, самостоятельная работа с данными предполагает, что все операции выполняются локально и минимизирует риски утечки данных.

Вывод

AgentMeasure предоставляет необходимый инструментарий для разработки стандартов в области измерения использования AI-агентов, позволяя пользователям и разработчикам точно понимать, что происходит в их системах и как это влияет на бизнес-результаты. Это поможет не только в улучшении работы существующих систем, но и в создании более прозрачных условий для будущих интеграций.

Открыть на GitHub: roy-tong/AgentMeasure →

Что нового на GitHub — короткие обзоры на русском Новые обзоры приходят в Telegram. Без спама, по делу.
Подписаться

Похожие статьи

Популярные темы на сайте