VibeCoderzVibeCoderz
Все статьи
2026/09/0411 мин чтения

Мониторинг AI агентов 2026 логи алерты трейсинг

Мониторинг AI агентов в 2026 году строится на трех слоях: логирование каждого шага, трейсинг вызовов инструментов и алерты при отклонениях. Без этого агент работает как черный ящик, а первый сигнал проблемы приходит от клиента в саппорт, а не от сист…

Содержание (12)+

Мониторинг AI агентов в 2026 году строится на трех слоях: логирование каждого шага, трейсинг вызовов инструментов и алерты при отклонениях. Без этого агент работает как черный ящик, а первый сигнал проблемы приходит от клиента в саппорт, а не от системы. Ниже разберем, как это настроить через LangSmith, Langfuse open-source и связку Prometheus плюс Grafana.

В 2026 году три инструмента закрывают мониторинг AI агентов: LangSmith для трейсинга в экосистеме LangChain, Langfuse как open-source альтернатива с self-host под MIT-лицензией, Prometheus и Grafana для инфраструктурных метрик. Ниже: пошаговая настройка, таблица цен и какие алерты ставить первыми.

Зачем вообще логировать каждый шаг AI агента?

Без логов агент падает молча: модель зациклилась, инструмент вернул мусор, а пользователь просто получил пустой ответ. Логирование каждого шага превращает эту пустоту в конкретную причину сбоя.

Изображение

Агент отличается от обычного API-запроса тем, что внутри него происходит несколько шагов подряд: вызов модели, выбор инструмента, парсинг результата, повторный вызов модели. Один тихий сбой на любом из этих шагов ломает финальный ответ, а классический мониторинг сервера этого не покажет. Именно поэтому в 2026 году стандартный стек наблюдаемости пополнился отдельным слоем под LLM-агентов.

Разработчики часто узнают о деградации модели или зависшем инструменте только по жалобе в поддержку. К этому моменту агент мог отдавать некорректные ответы несколько дней. Логирование каждого шага, от промпта до финального токена, закрывает этот разрыв. Записывается не факт ошибки, а весь путь: какой инструмент вызвал агент, что он получил в ответ, сколько токенов и времени это стоило.

Наш разработчик Cursor или Claude Code собирает агента за вечер, но без логов дальше приходится гадать, почему он иногда зависает на третьем шаге. Логи здесь не роскошь, а единственный способ увидеть агента изнутри.

Максим: «Мог просто засесть до пяти ночи и просто там править одну какую-то функцию, которая не работала. В моменте уже испотел, хотелось всё закрыть. Но понимал, что это можно решить и нужно решить, чтобы идти дальше.»

Логи как раз убирают эту слепую правку наугад. Вместо ночи с одной функцией видно точный шаг, на котором агент сломался.

Изображение

Что такое трейсинг tool calls в AI агентах?

Трейсинг tool calls, это запись всей цепочки вызовов инструментов агента: какой инструмент выбран, какие аргументы переданы, что вернулось и сколько это заняло по времени.

Trace, или трейс, это дерево из спанов: каждый спан, отдельный шаг агента. Вызов LLM, вызов инструмента, обращение к базе, повторный вызов модели с результатом. Без трейсинга видно только вход и выход агента целиком, а разбить это на составные шаги невозможно.

Трейсинг tool calls решает конкретную задачу: понять, выбирает ли агент правильный инструмент, передает ли верные аргументы и возвращает ли инструмент то, что нужно. По данным разбора OpenAI Agents SDK, добавление явного workflow_name в трейс ускорило фильтрацию логов и сократило время выполнения запроса с Web Search Tool почти вдвое, с 13 секунд до 6,66 секунды за счет более точной настройки вызова инструмента.

Изображение

Для вайбкодера это выглядит так: агент на Windsurf должен искать в интернете и суммировать результат. Если ответ пустой, трейсинг tool calls сразу показывает, на каком шаге инструмент вернул ошибку 429 вместо результата поиска, а не заставляет перечитывать весь код агента заново.

Как настроить LangSmith для трейсинга агента

Настройка LangSmith занимает 10-15 минут: подключить API-ключ, обернуть агента декоратором трейсинга, выбрать retention и посмотреть первые трейсы в дашборде.

LangSmith родом из экосистемы LangChain и лучше всего интегрируется именно с LangChain и LangGraph. Настройка LangSmith начинается с бесплатного тарифа Developer: 5000 трейсов в месяц, 14 дней хранения, одно рабочее пространство. Этого хватает на прототип и первые тесты агента.

Шаг 1. Подключить проект и API-ключ

Регистрация на smith.langchain.com, создание проекта, получение API-ключа. Ключ прокидывается в переменные окружения, и с этого момента каждый вызов через LangChain автоматически попадает в трейс без ручной инструментации.

Шаг 2. Настроить workflow_name и метаданные

Для агентов вне LangChain, например на OpenAI Agents SDK, трейсинг тоже встроен из коробки при активном API-ключе. Здесь стоит явно задавать workflow_name и group_id, это дает возможность фильтровать трейсы по конкретному сценарию, а не листать общий поток.

Шаг 3. Выбрать тариф под нагрузку

На продакшене бесплатного лимита не хватает почти всегда. Тариф Plus стоит $39 за место в месяц и включает 10 000 базовых трейсов с хранением 14 дней, а превышение считается по $2,50 за 1000 трейсов. Для команды из 10 человек это уже 390 долларов в месяц без учета превышений, потому что цена растет линейно за каждое место.

Чем Langfuse open-source отличается от LangSmith?

Langfuse open-source полностью бесплатен при self-host под MIT-лицензией и не берет плату за место в команде, в отличие от LangSmith с его помесячной оплатой за каждого пользователя.

Главное отличие в модели оплаты. LangSmith считает деньги за место в команде, Langfuse open-source, при self-host, вообще ничего не берет за пользователей: неограниченное число участников, неограниченные трейсы, весь функционал открыт под лицензией MIT. Условие одно, поднять инфраструктуру самому: PostgreSQL, ClickHouse, Redis и S3-совместимое хранилище, а типичные расходы на инфраструктуру такой связки составляют от 500 до 1000 долларов в месяц.

В январе 2026 года Langfuse купила компания ClickHouse вместе с раундом на 400 миллионов долларов при оценке в 15 миллиардов, но лицензия MIT осталась без изменений, а самостоятельный хостинг по-прежнему бесплатен (langfuse.com/self-hosting).

У облачной версии Langfuse своя логика тарифов: бесплатный Hobby на 50 000 юнитов в месяц (это в 10 раз больше, чем 5000 трейсов у бесплатного LangSmith), тариф Core за $29 в месяц на 100 000 юнитов с неограниченным числом пользователей, и Pro за $199 в месяц с хранением данных до трех лет. Юнит здесь, это трейс плюс каждый спан и каждая оценка внутри него, поэтому расход юнитов зависит не только от трафика, но и от глубины инструментации.

Langfuse open-source построен поверх стандарта OpenTelemetry и работает асинхронно, не добавляя задержки в основной путь запроса агента. Это тот случай, когда мониторинг не тормозит само приложение, что критично для агентов с жестким SLA по времени ответа.

Изображение

Как поставить алерты на ошибки AI агента?

Алерты на ошибки AI агента должны реагировать на три типа сбоев: рост доли неудачных вызовов инструмента, аномальный рост латентности и падение процента успешных LLM-оценок качества ответа.

Логи и трейсы показывают, что случилось, а алерты нужны, чтобы узнать об этом до того, как заметит пользователь. Без алертинга команда обычно видит проблему пост-фактум, через жалобу или через ручной просмотр дашборда раз в день, а это слишком поздно для агента, который отвечает клиентам в реальном времени.

Правило простое: не алертить на каждую единичную ошибку, а ставить пороги на долю ошибок за окно времени. Пример из практики настройки Grafana для инференса LLM: алерт на p95 латентность выше 3 секунд, удерживающийся дольше 10 минут, а не разовый скачок.

Три алерта, с которых стоит начать:

  • Доля неуспешных tool calls выше 5% за 15 минут
  • p95 латентность ответа агента выше целевого порога дольше 10 минут подряд
  • Процент положительных LLM-оценок (LLM-as-a-judge) упал ниже базовой линии за последний час
Изображение

Grafana Cloud AI Observability, запущенная в апреле 2026 года на конференции GrafanaCON в Барселоне, добавила именно такие алерты как отдельный тип телеметрии: разговоры и сессии агента теперь первоклассный сигнал наравне с метриками и логами (how2shout.com). Каналы доставки алертов стандартные: Slack, email, PagerDuty, вебхуки.

Нужны ли Prometheus и Grafana, если уже есть LangSmith или Langfuse?

Prometheus и Grafana закрывают инфраструктурный слой: нагрузку на сервер, память, очереди запросов, а LangSmith и Langfuse специализируются на самой логике агента, промптах и качестве ответов. В зрелом продакшене нужны оба слоя.

LangSmith и Langfuse open-source отвечают на вопрос "что делает агент внутри". Prometheus и Grafana отвечают на другой вопрос: "как ведет себя инфраструктура вокруг агента". Это разные уровни наблюдаемости, и путать их не стоит.

Связка Prometheus плюс Grafana собирает метрики через /metrics-эндпоинт, хранит их как временные ряды и рисует дашборды. Для AI-агента здесь важны не общие CPU и память, а специфичные метрики: токен-косты, латентность по шагам, частота отказов инструментов. Стандартная установка через Docker Compose занимает от 15 до 30 минут (jservo.com).

Есть и альтернативная связка для той же задачи, TICK-стек: Telegraf собирает метрики, InfluxDB хранит их как временные ряды, Grafana визуализирует и алертит. Полностью бесплатный и open-source вариант, который часто выбирают команды, уже привыкшие к InfluxDB для других сервисов.

На практике оптимальная схема выглядит так: Langfuse open-source или LangSmith для трейсинга логики агента, Prometheus и Grafana поверх для инфраструктурных алертов и единого дашборда, куда стекается всё. Если в команде есть DevOps, эта связка настраивается им же, кто уже держит остальной мониторинг, посмотрите каталог агентов для DevOps-задач на случай если часть настройки хочется делегировать AI-агенту.

Изображение

Какие метрики агента отслеживать в первую очередь

Из десятков возможных метрик реально критичны шесть: латентность, доля успешных tool calls, стоимость за задачу, процент LLM-оценок, TTFT и количество шагов на задачу.

Изображение

Метрик много, но большинство из них шум. Ниже таблица тех, что стоит выводить на главный дашборд с первого дня.

МетрикаЧто показываетТип сбора
Латентность (p50/p95)Скорость ответа агента целикомPrometheus, Grafana
Доля успешных tool callsНасколько надежны вызовы инструментовLangSmith, Langfuse
Cost per taskСтоимость одной задачи в токенахLangSmith, Langfuse
LLM-as-a-judge scoreКачество финального ответаLangfuse, Grafana AI Observability
TTFT (time to first token)Ощущение скорости для пользователяPrometheus, Grafana
Шагов на задачуНе зациклился ли агентТрейсинг (LangSmith, Langfuse)

Метрика cost per task особенно чувствительна к выбору модели. Агент на Claude Sonnet 4.6 при цене $3 за миллион входных и $15 за миллион выходных токенов обходится в разы дороже, чем тот же агент на DeepSeek V4 Flash с ценой $0,14 и $0,28 за миллион токенов соответственно. Без метрики стоимости за задачу переход на более дешевую модель для рутинных шагов остается незамеченным упущением, хотя разница в бюджете на масштабе может составлять десятки тысяч рублей в месяц.

Изображение

LangSmith Langfuse Prometheus Grafana что выбрать для агента

Для команды на LangChain логичнее LangSmith, для контроля бюджета и self-host, Langfuse open-source, а Prometheus плюс Grafana добавляются поверх любого из них ради инфраструктурных алертов.

Прямого победителя нет, инструменты закрывают разные слои задачи. Собрали сравнение по трем практическим критериям.

КритерийLangSmithLangfuse open-sourcePrometheus + Grafana
Цена входаБесплатно до 5000 трейсовБесплатно, self-host без лимитовБесплатно, только инфраструктура
Оплата за командуПо местам, $39/местоНе берет плату за пользователейНе применимо
Лучше всего дляПроектов на LangChain/LangGraphКонтроля бюджета, self-host, complianceИнфраструктурных алертов и общего дашборда
Слабое местоЦена растет линейно с числом местНужно поднимать и держать инфраструктуру самомуНе понимает логику самого агента

Наш опыт в VibeCoderz простой: для быстрого прототипа на Cursor или Claude Code хватает бесплатного тарифа LangSmith или Hobby-плана Langfuse. Как только агент уходит в продакшен и появляется команда, self-host Langfuse open-source обычно выгоднее по деньгам, а Prometheus с Grafana встают поверх для алертов, которые нельзя пропустить.

Изображение

Какие ошибки чаще всего допускают при мониторинге AI агентов

Три повторяющиеся ошибки: включают мониторинг слишком поздно, кладут персональные данные в лейблы метрик и настраивают алерты на единичные события вместо трендов.

Первая ошибка, откладывать мониторинг до первого крупного сбоя. Тогда его настраивают в панике, без понимания, какие метрики реально важны для конкретного агента, и дашборд превращается в свалку графиков, которые никто не читает.

Вторая ошибка, кардинальность в лейблах метрик Prometheus. Если в лейбл попадает email пользователя или id конкретного запроса, кардинальность метрик взрывается, а база метрик может лечь под собственным весом. Простое правило: лейблы должны быть ограниченным набором значений, например modelstatusendpoint, а не уникальными идентификаторами.

Третья ошибка, алерт на каждую единичную неудачу. Модель иногда ошибается, это нормальная часть работы с нестабильным по своей природе LLM. Алертить нужно на аномальный тренд за окно времени, а не на разовый сбой, иначе команда быстро начинает игнорировать уведомления вообще.

Изображение

Частые вопросы про мониторинг AI агентов

Что такое трейсинг AI агента простыми словами? Это запись всего пути одного запроса через агента: какие шаги он сделал, какие инструменты вызвал и что каждый шаг вернул. Похоже на бортовой самописец, только для одного диалога с моделью.

Чем Langfuse отличается от LangSmith на практике? Langfuse open-source бесплатен при self-host и не берет плату за место в команде. LangSmith удобнее внутри экосистемы LangChain, но платит команда за каждого участника отдельно.

Можно ли использовать Prometheus и Grafana без LangSmith или Langfuse? Можно, но тогда видна только инфраструктура: латентность, память, нагрузка. Логика самого агента, промпты и качество ответов останутся за кадром без отдельного слоя трейсинга.

Сколько стоит LangSmith в месяц для небольшой команды? Бесплатный тариф дает 5000 трейсов. Платный Plus стоит $39 за место, а команда из пяти человек уже платит 195 долларов в месяц без учета превышения лимита трейсов.

Нужен ли мониторинг на этапе MVP или только в продакшене? Нужен уже на MVP, хотя бы базовый. Бесплатных тарифов LangSmith или Langfuse Hobby хватает, чтобы увидеть первые сбои до того, как их увидит первый платящий пользователь.

Какие алерты настроить первыми для нового AI агента? Долю неуспешных tool calls и рост латентности выше нормы. Эти два алерта покрывают большинство критичных сбоев на старте, остальное можно добавлять по мере роста нагрузки.

Что такое OpenTelemetry и при чем тут мониторинг агентов? Это открытый стандарт передачи метрик, логов и трейсов между инструментами. Langfuse построен поверх него, поэтому данные не привязаны намертво к одному вендору и их легко перенести.

Глоссарий терминов мониторинга AI агентов

  • Трейсинг — запись полного пути выполнения одного запроса агента, от входа до финального ответа.
  • Спан — отдельный шаг внутри трейса: один вызов модели, один вызов инструмента.
  • Tool call — обращение агента к внешнему инструменту, например к поиску или базе данных.
  • Алертинг — автоматическое уведомление при выходе метрики за заданный порог.
  • TTFT — time to first token, время до появления первого символа ответа модели.
  • PromQL — язык запросов Prometheus для выборки и агрегации метрик.
  • OpenTelemetry — открытый стандарт сбора метрик, логов и трейсов, общий для разных инструментов наблюдаемости.
  • Self-host — размещение инструмента на собственной инфраструктуре вместо облачного тарифа вендора.

Итог какой стек мониторинга выбрать в 2026 году

Мониторинг AI агентов не требует выбора одного инструмента раз и навсегда. Логичная связка на 2026 год: LangSmith или Langfuse open-source для трейсинга логики агента и алертов по качеству ответа, Prometheus с Grafana поверх для инфраструктуры и единого дашборда. Начинать стоит с бесплатных тарифов, а докупать платные функции только когда реальная нагрузка это оправдывает.

Обзоры инструментов для сборки самого агента смотрите в каталоге AI-инструментов VibeCoderz, там же сравнение Cursor, Windsurf и Claude Code по задачам. Если нужна помощь с настройкой мониторинга под конкретный продакшен-сценарий, запишитесь на консультацию к Максиму.

All Posts

Автор

Елисавета Наговицына
Елисавета Наговицына

Предприниматель · Контент-маркетолог · SEO-стратег · AI-продуктолог

2026/09/04

400 000+ органических переходов за 3 месяца. Со-основатель GoBanana (231K пользователей, 12+ млн ₽ без рекламы) и NeuroScribe (65K пользователей). SEO/GEO-стратегии для AI-поисковиков, 1 700+ единиц контента, 17+ реализованных стратегий.

Об авторе →

Читать далее

📢 Новость

Claude Code: новый CLI-агент от Anthropic

Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.

2026/02/27
📝 Конспект

Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов

Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.

2026/02/28
📝 Конспект

YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026

Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.

2026/02/28
📝 Конспект

Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода

Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.

2026/02/28
📝 Конспект

Vk Fast Cash Strategy

Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех

2026/02/28