Компания Z.ai представила обновление своей флагманской модели — GLM-5.1. Главная сенсация даже не в том, что она возглавила рейтинг SWE-bench Pro, а в «железе», на котором её готовили. Впервые модель такого уровня была полностью обучена без участия NVIDIA или AMD.
Весь процесс обучения проходил на кластере из 100 000 чипов Huawei Ascend 910B с использованием фреймворка MindSpore. Это доказывает, что технологический суверенитет в AI возможен, а для нас, вайбкодеров, это означает появление еще одного мощного игрока на рынке опенсорсных агентов.
Технические характеристики
GLM-5.1 — это архитектура MoE (Mixture of Experts) с внушительными параметрами:
- Общий объем: 744 млрд параметров (активны ~40 млрд на токен).
- Контекстное окно: 200 000 токенов (вывод до 128 000 токенов).
- Датасет: 28.5 трлн токенов (уровень Llama 4 и GPT-5).
- Результат SWE-bench Pro: 58.4 балла (1-е место в мире).
- Лицензия: MIT (веса уже доступны на HuggingFace).
Агентский цикл: 8 часов автономной работы
GLM-5.1 — это не просто «умный чат», а полноценный агент. Ключевое изменение по сравнению с версией 5.0 — это асинхронное обучение с подкреплением (RL). Z.ai разделили этапы генерации и обучения, что позволило модели справляться с задачами, требующими сотен вызовов инструментов на протяжении многих часов.
Согласно тестам METR, модель способна на 8 часов непрерывной автономной работы над одной задачей. Она использует стратегию «break-and-repair»: разбивает сложную проблему на подзадачи, ставит эксперименты, анализирует вывод терминала и умеет откатываться назад, если зашла в тупик. В качестве демо Z.ai показали, как агент с нуля собирает окружение рабочего стола Linux и оптимизирует векторную БД через 600+ итераций.
Что это значит для вайбкодеров?
Для тех, кто привык кодить через Cursor или Windsurf, GLM-5.1 может стать отличной альтернативой Claude 3.5 Sonnet. Благодаря архитектуре Dynamic Sparse Attention (DSA), модель эффективно работает с длинным контекстом, не «съедая» всю память при инференсе.
Тот факт, что модель с лицензией MIT выдает 58.4 на SWE-bench Pro (тест на исправление реальных багов в реальных репозиториях), означает, что скоро мы увидим еще более автономных и дешевых локальных агентов, способных фиксить легаси-код без нашего участия.