Jev AI: Полный разбор модели принятия решений, роутинг LLM и Claude Code скилл
Разбор новой вероятностной модели Jev от Typeface AI. Как классифицировать 300 заявок за 1 цент, настроить роутер моделей и создать скилл для Claude Code.
Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
🎯 О чём этот конспект: Детальный практический разбор архитектуры и применения новой ИИ-модели Jev от компании Typeface AI (разработанной бывшим ключевым участником команды ChatGPT). Модель работает на вероятностных расчётах (RLCD) вместо потоковой генерации текста, что делает её в сотни раз быстрее и дешевле классических LLM. В конспекте показано 3 готовых практических кейса: пакетная классификация заявок, умный роутер моделей для сокращения костов и кастомный скилл для Claude Code.
👤 Кому будет полезно: Вайбкодерам, разработчикам AI-агентов, автоматизаторам n8n/make и продуктовым инженерам, которые сталкиваются с высокими расходами на токены при парсинге больших списков или долгой обработкой классификационных задач в агентах.
✨ Что получите: Понимание архитектуры вероятностных моделей принятия решений, логику создания экономичного роутера моделей (Haiku / Sonnet / Opus) и готовый скилл (Claude Code Skill) для ускорения фильтрации больших массивов данных в 10–50 раз с минимальной стоимостью токенов.
1. Архитектура Jev AI: почему вероятностная модель превосходит генеративные LLM в задачах классификации
Контекст: Большинство разработчиков привыкли решать любые аналитические задачи с помощью стандартных текстовых LLM (GPT-4o, Claude 3.5 Sonnet). Обычная языковая модель при поступлении запроса генерирует токен за токеном, на что уходит от нескольких секунд до десятков секунд, а также тратятся дорогие output-токены. Модель Jev от компании Typeface AI работает принципиально иначе: это не текстовая модель, а калиброванная система принятия решений. Она не умеет писать длинные эссе или генерировать код, но обучена методом RLCD (Reinforcement Learning from Calibration Data) моментально выдавать откалиброванные математические вероятности по заданным условиям. За счёт отсутствия генерации текста инференс занимает доли секунды (0.01–0.6 с) и практически ничего не стоит.
Тайминг:[00:07], [01:01], [01:88], [02:16]
Выгода:
Стоимость: всего $0.04 за 1 млн входных токенов (input), выходные токены (output) бесплатны ($0.00).
Скорость: моментальный ответ (в десятки раз быстрее Sonnet — 0.0–0.6 секунды против 8.5 секунд на единичный запрос).
Нулевые текстовые галлюцинации благодаря вероятностному формату ответов.
Как применить:
Шаг 1: Подключение к API — OpenRouter / Typeface AI] — Зарегистрируйтесь на официальном сайте Typeface AI либо используйте универсальный шлюз OpenRouter для доступа к эндпоинту модели jev (контекстное окно на данный момент составляет 32 000 токенов).
Шаг 2: Проектирование запроса под вероятности — REST API / JSON] — Формулируйте промпты не как задачу «напиши развёрнутый анализ», а как набор бинарных или категоризационных гипотез. Передавайте контекст и требуйте оценки распределения вероятностей по исходам.
Пример структуры задачи для Jev (оценка инвойса):
Входящий инвойс: "Оплата консультационных услуг от ИП Смирнов, сумма $12,000, реквизиты изменены 2 часа назад".
Оцени вероятности следующих исходов:
1. Инвойс мошеннический (Fraud)
2. Инвойс валиден и готов к оплате (Clean)
3. Требуется ручная верификация безопасности (Review Needed)
Ответ модели возвращается мгновенно в виде матрицы:
Результат: Мгновенное принятие решений без задержек на генерацию строк, готовое для ветвления логики в бэкенде или кодовой базе автопилотов, ботов и игр.
2. Пакетная обработка входящих данных: Jev против Claude 3.5 Sonnet на 300 заявках
Контекст: Типичная боль любого сервисного бизнеса — разбор десятков и сотен входящих заявок из Telegram, WhatsApp и почты. Традиционный прогон сотен заявок через топовые модели вроде Sonnet обходится дорого и занимает ощутимое время. В эксперименте сравнивалась обработка 300 сырых клиентских заявок сервисного центра по 4 параметрам: спам, категория обращения, срочность и необходимость вмешательства человека. Jev доказал превосходство в скорости и стоимости при сопоставимом уровне точности.
Скорость: 300 заявок обработаны за 11.5 секунд на Jev против более чем 2 минут на Claude 3.5 Sonnet (ускорение в ~10 раз).
Экономия бюджета: обработка массива обошлась в $0.01 на Jev против $1.18 на Sonnet (Jev более чем в 100 раз дешевле).
Точность: Jev показал 96% в детекции спама (Sonnet 100%), 96% в определении категорий (Sonnet 94%), 64% в определении срочности (Sonnet 65%) и 89% в определении потребности в операторе (Sonnet 93%).
Как применить:
Шаг 1: Подготовка массива и структуры валидации — Node.js / Python] — Соберите массив заявок из CRM/базы данных в единый файл (data.json или requests.csv). Задайте жесткий набор классификационных вопросов:
Является ли заявка спамом? (Да / Нет)
Категория: жалоба, покупка, поддержка, цена или партнёрство?
Срочность: ответить сегодня / в течение недели?
Требуется ли участие живого человека? (Да / Нет)
Шаг 2: Батч-запуск через API Jev — OpenRouter API] — Настройте параллельную отправку запросов к модели Jev. При необходимости увеличьте количество классификационных признаков — добавление даже 19 дополнительных вопросов не увеличивает время инференса (задержка держится в пределах 500–700 мс).
Пример структуры скрипта для классификации заявки через Jev:
Результат: Автоматизированный конвейер триажа заявок, обрабатывающий сотни обращений за копейки без очередей и ожидания.
3. Построение экономичного LLM-роутера: сокращение расходов на стек в 2 раза
Контекст: Использование тяжелых флагманских моделей (Claude Opus, GPT-4) для простых рутинных задач — частая ошибка при построении ИИ-продуктов, сжигающая бюджет компании впустую. Простые математические операции или короткие контентные задачи не требуют дорогостоящего инференса. Для оптимизации расходов на шлюзе создается умный роутер, где Jev выступает сверхбыстрым арбитром: он классифицирует сложность входящего промпта за доли секунды и направляет его в соответствующую модель по иерархии (Haiku → Sonnet → Opus).
Тайминг:[05:72], [06:30], [06:50], [06:89]
Выгода:
Сокращение затрат почти в 2 раза: при объёме 1000 запросов в день с долей простых задач в 60% расходы на Claude 3.5 Opus составляют ~$420/мес. С роутером на базе Jev сумма снижается до ~$210–230/мес.
Стоимость маршрутизации равна почти нулю ($0.04 / 1M токенов).
Как применить:
Шаг 1: Определение уровней сложности задач — Разделите входящие пользовательские промпты на 3 градации:
Легкие (Easy): простые расчеты, форматирование, исправление опечаток → отправка в Claude 3.5 Haiku.
Средние (Medium): написание постов, структурирование планов, генерация стандартных email → отправка в Claude 3.5 Sonnet.
Сложные (Hard): архитектура БД, сложный системный дизайн, аудит безопасности, многошаговая логика → отправка в Claude 3 Opus.
Шаг 2: Реализация логики маршрутизатора — Настройте прослойку перед вызовом рабочей LLM. Сначала запрос отдается Jev, который определяет вес задачи и возвращает класс.
Пример логики роутера:
import osimport requestsdef route_prompt(user_prompt: str) -> str: router_instruction = f""" Оцени сложность задачи по шкале вероятностей: - easy: простые вычисления, базовые ответы, рерайтинг - medium: копирайтинг, стандартный код, структурирование данных - hard: системная архитектура, сложные БД, комплексные математические доказательства Задача: "{user_prompt}" """ # 1. Запрос к Jev для моментальной оценки response = requests.post( "https://openrouter.ai/api/v1/chat/completions", headers={"Authorization": f"Bearer {os.getenv('OPENROUTER_API_KEY')}"}, json={ "model": "typeface/jev", "messages": [{"role": "user", "content": router_instruction}] } ).json() # Предположим, Jev вернул категорию с наибольшей вероятностью predicted_tier = response["choices"][0]["message"]["content"] # "easy" | "medium" | "hard" # 2. Выбор целевой модели if "easy" in predicted_tier: target_model = "anthropic/claude-3-5-haiku" elif "medium" in predicted_tier: target_model = "anthropic/claude-3-5-sonnet" else: target_model = "anthropic/claude-3-opus" return target_model
Результат: Инфраструктура автоматически оптимизирует расходы, не теряя в качестве на сложных задачах и не переплачивая за элементарные действия.
4. Создание кастомного скилла для Claude Code: ускорение агентов в 5 раз через пре-фильтрацию (Jev Decider)
Контекст: Когда ИИ-агенты (например, Claude Code) получают комплексную задачу проанализировать большой файл с сотнями строк и написать развёрнутые ответы только по целевым записям, агент начинает последовательно читать весь файл целиком. На чтение 300 записей у агента уходит до 5 минут, после чего он часто ошибается в фильтрации (например, отбирает 37 сущностей вместо реальных 25). Чтобы избавить агента от «тупого» чтения и сэкономить его дорогой контекст, создается инструмент-навык (Skill) Jev Decider. Агент делегирует первичный отсев Jev, получает чистый список целевых ID за 10 секунд и мгновенно приступает к глубокой генерации ответов.
Экономия времени выполнения задачи агентом: 1–1.5 минуты общего пайплайна против 5+ минут чтения агентом вслепую.
Повышение точности выборки: точный отбор 25 из 25 срочных жалоб вместо 37 ошибочно отобранных агентом Sonnet.
Стоимость первичного отсева 300 записей составляет всего $0.01.
Как применить:
Шаг 1: Концепция создания скилла Claude Code — Создайте конфигурационный файл скилла в папке .claude/skills/ вашего проекта или глобально. Скилл инструктирует Claude Code: «Если список для анализа превышает 20 элементов, запрещено читать его напрямую через базовую модель. Передай данные в Jev Decider с условием фильтрации».
Шаг 2: Реализация скрипта-помощника — Напишите легковесный CLI-скрипт, который принимает файл и условие, быстро прогоняет его через Jev и возвращает только отфильтрованные строки.
Пример структуры скилла для Claude Code (jev-decider.skill.json / Markdown-инструкция):
# Name: Jev Decider Skill# Trigger: Любой запрос на анализ/фильтрацию списков, таблиц или массивов данных длиннее 20 элементов.---## Правило работы:1. Никогда не читай большие массивы сырых данных (>20 записей) напрямую через системный контекст.2. Вызови локальный скрипт jev_filter: python3 scripts/jev_filter.py --input <путь_к_файлу> --criteria "<критерии_отбора>"3. Получи чистый список отфильтрованных ID/записей.4. Выполни генеративную работу (написание ответов, отчётов) ТОЛЬКО для записей из полученного списка.
Пример промпта для запуска агента в терминале:
В файле data/requests.json находится 300 входящих заявок нашего сервиса.
Найди все срочные жалобы, где клиент недоволен и ждать нельзя, и напиши на каждую черновик ответа от лица менеджера по 3-4 предложения в файл answers.md.
Не задавай уточняющих вопросов, действуй через Jev Decider.
Результат: Агент мгновенно отсекает 90% нерелевантной информации через суб-модель Jev и концентрирует свой вычислительный ресурс только на качественном решении задачи.
FAQ
В: Является ли Jev полноценной заменой Claude 3.5 Sonnet или GPT-4o? О: Нет, Jev категорически не заменяет генеративные текстовые модели. Он не способен писать художественный текст, генерировать сложный код или вести осмысленный диалог. Его предназначение — узкоспециализированное моментальное принятие решений и калибровка вероятностей (true/false, выбор категорий, роутинг).
В: Почему Jev работает настолько дешевле других моделей? О: Архитектура Jev оптимизирована под метод RLCD и возвращает вероятностные матрицы вместо генерации текста токен за токеном. Входные токены стоят $0.04 за 1 млн, а выходные токены бесплатны, так как вычислительные затраты на генерацию распределения вероятностей минимальны.
В: Каков размер контекстного окна у Jev на данный момент? О: Модель поддерживает контекстное окно объемом 32 000 токенов. Этого достаточно для обработки сотен заявок или табличных строк за один вызов.
В: Где и как можно протестировать Jev прямо сейчас? О: Модель доступна для использования через официальный портал Typeface AI, а также добавлена в каталог агрегатора OpenRouter (поиск по названию модели Jev), откуда её можно подключить по стандартному OpenAI-совместимому REST API.
В: Справится ли Jev с автономным управлением или логикой в реальном времени? О: Да, благодаря скорости отклика менее чем за сотню миллисекунд разработчики уже используют модель для логики игровых NPC и прототипов автопилота машинного зрения, где Jev на лету решает, нужно ли остановиться на знак «STOP» или продолжить движение.
Ресурсы и ссылки
Typeface AI — компания-разработчик модели Jev — упомянут в видео.
OpenRouter — API-агрегатор для вызова модели Jev и интеграции в стек роутинга — упомянут в видео.
Claude Code — агентный терминальный CLI-инструмент от компании Anthropic — упомянут в видео.
Конспект создан на основе видео «ДЖЕФ: Новая AI модель, которая перевернет всё? Разбор и 3 реальных кейса» канала автора. Все права на оригинальный материал принадлежат авторам.Источник: https://www.youtube.com/watch?v=TTYefEu8sxw