Jev и System 1: Ультрабыстрый ИИ для классификации, роутинга инструментов и принятия решений без генерации текста
Разбор модели Jev от System 1: почему отказ от генерации токенов делает классификацию и выбор MCP-инструментов в 200 раз дешевле и в разы быстрее обычных LLM.
Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Разбор принципиально нового класса моделей — Jev (от компании System 1 / Typespace, основанной сооснователем ChatGPT Диего Альмейдой). Модель вообще не умеет генерировать связный текст: вместо медленной авторегрессионной генерации токенов она принимает состояние системы (JSON, текст) и параллельно возвращает откалиброванные вероятности решений. Это позволяет ускорить выполнение задач классификации, роутинга агентов и выбора MCP-инструментов в 6–200 раз при стоимости в разы ниже Gemini Flash или Claude Haiku.
👤 Кому будет полезно:
Разработчикам AI-агентов и вайбкодерам, строящим мультиагентные системы в Cursor, Windsurf или Claude Code.
Инженерам, оптимизирующим latency и затраты на вызовы LLM при ticket triage, парсинге команд умного дома и browser automation.
Архитекторам, которые ищут замену дорогим и склонным к галлюцинациям саб-агентам-гардам (Guardrails / Model Routers).
✨ Что получите:
Понимание архитектурного сдвига от System 2 (медленная генерация токенов) к System 1 (параллельные мгновенные решения).
Конкретные схемы работы с тремя типами примитивов Jev: Choice, Score и New (вероятность True/False).
Готовые сценарии интеграции Jev в пайплайны роутинга тулов (MCP), сортировки входящих данных и валидации действий агента.
1. Архитектура System 1: отказ от токенов ради параллельных решений
Контекст: Классические фронтир-модели (GPT-4o, Claude 3.5 Sonnet, Gemini) оптимизированы под человеческие предпочтения через RLHF и заточены на последовательную посимвольную генерацию связного текста. Для программных систем такой подход избыточен: если коду нужно лишь узнать категорию заявки или статус флага, авторегрессионный цикл впустую тратит драгоценные секунды и деньги на генерацию лишних токенов. Модель Jev от компании System 1 (Typespace), разработанная командой экс-сооснователя ChatGPT Диего Альмейды, построена на концепции «быстрого интуитивного мышления» Даниэля Канемана (System 1). В ней полностью отсутствует авторегрессионный цикл: модель принимает контекст, JSON или состояние и параллельно оценивает типизированные вопросы за миллисекунды с калиброванной уверенностью (Reinforced Learning with Calibrated Decisions).
Тайминг:[00:15], [00:46], [03:23], [03:43]
Выгода:
Нулевое время ожидания на генерацию текстовых пояснений (time-to-first-decision от 100 до 200 мс).
Исключение галлюцинаций в структуре ответа: вы получаете строго типизированный JSON с оценкой вероятности вместо непредсказуемого текста.
Как применить:
Шаг 1: Получение доступа к Typespace Playground — Typespace Console — Зарегистрируйтесь в списке ожидания на платформе Typespace (аппрув обычно занимает от пары часов до суток) и получите доступ к Playground и API-ключам.
Шаг 2: Формирование состояния (State) вместо промпта — Редактор кода / Cursor — Перестаньте формулировать системные промпты вида «Ты полезный ассистент, верни только JSON...». Подготовьте входной объект состояния (State), содержащий чистые факты (payload задачи).
Шаг 3: Определение типизированных вопросов — Typespace API — Передайте массив вопросов, которые модель должна вычислить параллельно за один сетевой запрос.
Результат: Параллельная мгновенная оценка всех полей состояния без ожидания последовательной генерации текста.
2. Экономика и производительность: сокращение затрат в 20–200 раз
Контекст: Поддержание цепочек агентов в продакшене требует постоянной верификации шагов, валидации безопасности (guardrails) и маршрутизации. Даже использование сверхдешевых легковесных моделей вроде Gemini 2.5 Flash или Claude 3.5 Haiku на миллионах запросов создает значительный latency-оверхед и бьет по бюджету. Например, компания Vercel перевела часть классификационных задач с Gemini 2.5 Flash на Jev: скорость возросла в 6 раз, а точность на бенчмарках полностью перекрыла требования (eval saturation). В стресс-тестах с управлением ботами в реальном времени (например, непрерывная игра в Doom в течение часа с непрерывным потоком запросов к Jev) суммарная стоимость сессии составила всего около $7.
Тайминг:[00:72], [01:16], [01:46], [03:04]
Выгода:
Снижение стоимости одного запроса на классификацию в 20–200 раз по сравнению со стандартными LLM.
Ускорение классификационных этапов пайплайна в 6 раз по сравнению с Gemini Flash.
Как применить:
Шаг 1: Аудит пайплайнов на наличие «скрытых LLM-налогов» — Анализ логов агента — Найдите в проекте все места, где LLM используется исключительно для принятия бинарных решений, роутинга между ветками кода или скоринга эмоций.
Шаг 2: Замена легковесных моделей на API-вызовы Jev — Бэкенд / n8n / Python — Вынесите этап классификации в отдельный микросервис или функцию роутинга, вызывающую эндпоинт Jev.
Шаг 3: Настройка стриминга решений для Realtime-систем — Python / Node.js — Настройте обработку решений с минимальным latency (до 185 мс на операцию), что позволяет встраивать ИИ в real-time циклы (браузерная автоматизация, игры, IoT-устройства).
Результат: Снижение себестоимости агентского цикла до долей цента при сохранении детерминированной надежности.
3. Базовые примитивы решений: Choice, Score и New
Контекст: Вся работа с Jev строится вокруг трех четко формализованных примитивов принятия решений. Вместо написания пространных инструкций разработчик оперирует примитивами: Choice (выбор одной или нескольких опций из заданного набора критериев), Score (градуированная числовая шкала или уровень уверенности/состояния) и New (вероятность истинности конкретного утверждения от 0% до 100%). Для каждого ответа модель возвращает точное распределение вероятностей и откалиброванный уровень уверенности (confidence level). Это полностью исключает проблему галлюцинаций в формате JSON-ответа, с которой часто сталкиваются вайбкодеры при использовании response_format: {"type": "json_object"} в обычных LLM.
Тайминг:[02:08], [02:36], [04:51], [05:25]
Выгода:
Получение калиброванной метрики уверенности (confidence value), по которой в коде можно настроить пороги срабатывания (например, передавать оператору, если уверенность ниже 75%).
Отсутствие необходимости парсить и валидировать Markdown/JSON из текстового ответа LLM.
Как применить:
Шаг 1: Использование примитива choice для категоризации — Typespace API — Передайте набор взаимоисключающих критериев (например, выбор приоритета: ["low", "medium", "high", "critical"]).
Шаг 2: Применение примитива score для градации состояний — Typespace API — Задайте шкалу для измерения тональности клиента, степени повреждения или уровня риска транзакции (например: calm, civil, angry).
Шаг 3: Применение примитива new для булевой валидации — Typespace API — Задайте прямой проверочный вопрос (например: «Упоминается ли в запросе жесткий дедлайн?»), чтобы получить процент вероятности True/False.
{
"request_title": "customer_support_triage",
"state": {
"message": "It's been over a week. Nobody has responded to my report about the Wi-Fi. We are losing business!",
"user_role": "store_manager",
"location": "Store #402"
},
"evaluations": {
"priority_choice": {
"primitive": "choice",
"instruction": "What priority should be assigned to this ticket?",
"criteria": ["low", "medium", "high", "critical"]
},
"customer_frustration_score": {
"primitive": "score",
"instruction": "Rate customer frustration level",
"scale": ["calm", "civil", "angry"]
},
"has_explicit_deadline": {
"primitive": "new",
"instruction": "Does this text mention a strict deadline or immediate ongoing financial loss?"
}
}
}
Результат: Детерминированный ответ с массивом вероятностей (например: Medium — 65%, High — 30%; Frustration: angry — 88%; Deadline — True с вероятностью 85%).
4. Сверхбыстрый Model Router и выбор инструментов (Tool Calling / MCP)
Контекст: Современные AI-агенты тратят больше половины времени и контекстного окна на выбор нужного инструмента: они прочитывают список из десятков MCP-инструментов (Model Context Protocol), формулируют аргументы и часто ошибаются в выборе тула. Если поручить выбор инструмента обычной LLM, это создает огромную задержку. Jev можно использовать как ультрабыстрый шлюз: модель за несколько миллисекунд оценивает состояние агента и сопоставляет его со списком доступных tool calls, возвращая конкретный идентификатор инструмента с процентом уверенности. То же самое применимо для маршрутизации моделей (Model Routing): дешевый классификатор Jev определяет сложность входящего промпта и решает, направить ли его в дешевую модель или передать в тяжелую reasoning-модель.
Тайминг:[01:04], [04:72], [05:68]
Выгода:
Снижение задержки при вызове инструментов в агентских пайплайнах с секунд до сотен миллисекунд.
Экономия дорогого контекстного окна больших моделей (Claude 3.5 Sonnet / GPT-4o), которые освобождаются от рутинной фильтрации списков тулов.
Как применить:
Шаг 1: Формирование плоского списка доступных действий — Cursor / Claude Code — Определите набор доступных MCP-функций в виде строковых идентификаторов (например: ["ticket_status", "wifi_troubleshoot", "escalate_to_human", "refund_process"]).
Шаг 2: Настройка Jev как селектора инструментов — Typespace API — Передайте текущее намерение пользователя и контекст диалога в Jev с типом вопроса choice.
Шаг 3: Условное ветвление в коде агента — Python / TypeScript — Если уверенность (confidence) превышает порог (например, 80%), сразу вызывайте целевой тул. Если модель сомневается — передавайте выбор тяжелой reasoning-модели.
interface ToolSelectionResult { selected_tool: string; confidence: number;}async function selectMcpTool(userPrompt: string): Promise<string> { const response = await fetch("https://api.typespace.com/v1/eval", { method: "POST", headers: { "Authorization": `Bearer ${process.env.TYPESPACE_API_KEY}`, "Content-Type": "application/json" }, body: JSON.stringify({ state: { prompt: userPrompt }, questions: [ { id: "target_tool", type: "choice", instruction: "Which MCP tool must be executed to resolve this user state?", criteria: [ "check_ticket_status", "run_wifi_diagnostics", "search_knowledge_base", "request_human_handover" ] } ] }) }); const data = await response.json(); const topChoice = data.results.target_tool; // Если уверенность высокая — выполняем инструмент напрямую if (topChoice.confidence > 0.80) { return topChoice.winner; } // Фолбэк на сложную reasoning LLM при низкой уверенности return fallbackToReasoner(userPrompt);}
Результат: Мгновенный детерминированный выбор нужного действия в MCP-архитектуре без необходимости запускать тяжелые LLM на каждый шаг агента.
5. Гибридная архитектура ПО: мост между жесткой логикой и вероятностным ИИ
Контекст: Классическое программирование детерминировано: оно опирается на операторы if/else, строгие схемы типов и гарантирует повторяемость 100% времени. Агенты на базе больших LLM предельно гибки, но непредсказуемы: они могут отклоняться от инструкций, ломать форматы и действовать стохастически. Jev формирует новый гибридный слой (Hybrid AI Software). В этой схеме фундамент приложения пишется на чистом детерминированном коде, а все нелинейные развилки (парсинг естественного языка в IoT, проверка транзакций на фрод, навигация в браузере через Browser Use) делегируются модели быстрых решений. В демонстрациях Jev мгновенно парсит голосовые команды умного дома («выключи весь свет в гостиной и поставь кофе») за 185 мс, передавая в шину событий готовый массив переключателей.
Тайминг:[02:64], [04:00], [04:33], [05:88]
Выгода:
Полная предсказуемость логики приложения при сохранении понимания естественного языка.
Реакция интерфейса без задержек (185 мс для IoT-систем и Smart Home устройств).
Как применить:
Шаг 1: Разделение логики на жесткий код и вероятностные гейты — Архитектура проекта — Зафиксируйте бизнес-правила в детерминированном коде, а субъективную оценку отдайте Jev в виде структурированного запроса.
Шаг 2: Реализация локального клиента в CLI / Claude Code — Терминал — Подключите вызовы Typespace к CLI-утилитам или агентам Claude Code для быстрой сортировки файлов, проверки git diff на критические баги и категоризации логов.
Шаг 3: Запуск и тестирование в Typespace Console — Typespace Playground — Проверьте поведение модели на граничных состояниях (edge cases), протестировав скорость отклика и точность вероятностного распределения перед деплоем в прод.
# Пример быстрой проверки гипотезы через Typespace CLI / cURLcurl -X POST https://api.typespace.com/v1/eval \ -H "Authorization: Bearer $TYPESPACE_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "state": { "command": "shut off all the music in the house and dim living room lights" }, "questions": [ { "id": "speaker_action", "type": "choice", "criteria": ["turn_off", "keep_playing", "mute"] }, { "id": "target_lights_action", "type": "choice", "criteria": ["living_room_dim", "all_lights_off", "no_action"] } ] }'
В: Может ли Jev написать письмо, саммари текста или сгенерировать программный код? О: Нет, модель в принципе не способна генерировать связный текст или код. У нее нет авторегрессионного механизма генерации токенов. Она предназначена исключительно для оценки состояния и параллельного возврата решений, вероятностей и оценок по заданным критериям.
В: Чем Jev отличается от режима Structured Outputs / JSON Mode в OpenAI или Anthropic? О: В стандартных LLM для Structured Outputs модель все равно генерирует токены один за другим (просто валидируя их через грамматику или маску логитов), что занимает секунды и требует оплаты каждого сгенерированного токена. Jev оценивает все вопросы параллельно в рамках одного прямого прохода нейросети за миллисекунды и обходится в 20–200 раз дешевле.
В: Как Jev помогает в сценариях с Browser Use и браузерной автоматизацией? О: При автоматизации браузера агенту на каждом шаге нужно быстро решать, по какому селектору кликнуть, достигнута ли цель страницы или возникла ли ошибка/капча. Jev решает эти микрозадачи за доли секунды без ожидания медленного ответа большой мультимодальной LLM, драматически ускоряя работу браузерного агента.
В: Как получить доступ к Jev и Typespace? О: Платформа открывает доступ по списку ожидания на официальном сайте Typespace Console. Внутри личного кабинета доступны веб-плейграунд с интерактивными примерами, генерация API-ключей, аналитика использования и возможность интеграции модели напрямую в окружения разработки (включая Claude Code и локальные скрипты).
В: Что такое калиброванные решения (Calibrated Decisions) в Jev? О: Большинство языковых моделей страдают от гиперуверенности (overconfidence) — они выдают неверный ответ с видимой уверенностью 99%. Jev обучен с использованием обучения с подкреплением на калиброванных решениях: если модель возвращает уверенность 78%, это означает математически выверенную статистическую вероятность ошибки в ~22%, что позволяет разработчикам выставлять надежные пороги в коде.
В: Можно ли использовать Jev локально без обращения к облачному API? О: На текущий момент модель предоставляется авторами через облачный API Typespace с минимальной задержкой обработки запросов. Следите за обновлениями команды System 1 по поводу возможного релиза легковесных весов для локального инференса.
Ресурсы и ссылки
Typespace (System 1) — Официальная платформа и консоль разработчика с Playground и API для модели Jev — упомянут в видео.
Vercel AI Case Study — Кейс компании Vercel по замене Gemini 2.5 Flash на Jev для классификационных задач — упомянут в видео.
Browser Use / Open Code — Тестирование Jev в сценариях скоростной веб-автоматизации — упомянут в видео.
Диего Альмейда (Diego Almeida) — Сооснователь ChatGPT и руководитель разработки Jev в System 1 — упомянут в видео.
Pstack — Библиотека навыков для агентов от автора канала — упомянут в видео.
Конспект создан на основе видео «This New Model is 200x Cheaper and It Can't Even Write» канала Frank Farrell (AI Builder). Все права на оригинальный материал принадлежат авторам.Источник: https://www.youtube.com/watch?v=2Bs0Ink_-Uo