10 июля 2026 один разработчик под ником vforno написал в Hacker News: «Show HN: GLM 5.2 on my slow computer». За сутки — 453 поинта и первое место. 7000+ звёзд на GitHub за первый день.
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Claude Code: новый CLI-агент от Anthropic
Anthropic выпустила Claude Code — терминальный AI-агент для разработчиков. Инструмент работает прямо в командной строке и умеет писать, редактировать и запускать код.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
YouTube-канал с монетизацией из любой точки мира: Пошаговый гайд 2026
Инструкция по созданию YouTube-канала: обход блокировок SMS, настройка расширенных функций через виртуальные номера и правила безопасности для монетизации.
Windsurf Code Maps: Как глубоко понимать архитектуру проекта перед написанием кода
Полный гайд по Windsurf Code Maps, модели Sway 1.5 и Sway Grep. Узнайте, как визуализировать архитектуру кода и ускорить разработку в 13 раз.
Vk Fast Cash Strategy
Аудитория ВКонтакте — это те же люди, что и в Instagram, но 'социальный контракт' площадки другой. Если Instagram — это 'дорогой ресторан' с демонстрацией успеха, то VK — это 'душевная шашлычная'. Здесь не работает глянцевый 'успешный успех
10 июля 2026 один разработчик под ником vforno написал в Hacker News: «Show HN: GLM 5.2 on my slow computer». За сутки — 453 поинта и первое место. 7000+ звёзд на GitHub за первый день.
Что он сделал: написал движок на языке C (один файл, 2400 строк), который запускает GLM-5.2 — модель с 744 миллиардами параметров — на обычном ноутбуке с 25 гигабайтами оперативной памяти. Без видеокарты. Без Python. Без Docker. Ни одной внешней зависимости.

Медленно? Да. Но работает. И это меняет то, что вообще считается возможным.
Colibri — MIT open-source движок на одном C-файле для запуска GLM-5.2 (744B параметров) с 25 ГБ RAM. Модель стримится с диска, нужные части подгружаются по требованию. Скорость от 0.05 ток/сек на слабом железе до 1+ ток/сек на быстром SSD. В статье: как работает, что нужно из железа, установка, честные ограничения.
Ссылки:
Обычно — да. Полная загрузка GPT-4 или похожей по размеру модели в оперативку потребовала бы сотни гигабайт RAM и несколько топовых GPU.
Но GLM-5.2 устроена иначе. Она называется MoE — Mixture of Experts, «смесь экспертов». Это как большой справочник, в котором тысячи разделов, но при ответе на конкретный вопрос ты открываешь только нужные страницы — остальное остаётся закрытым.
Из 744 млрд параметров GLM-5.2 при генерации каждого слова реально работает только около 40 млрд. Остальные в этот момент не нужны.
Colibri использует это свойство. Маленькую постоянную часть (около 10 ГБ) держит в оперативной памяти всегда. Большую часть (~370 ГБ) кладёт на жёсткий диск и подгружает ровно то, что нужно прямо сейчас. Когда слово сгенерировано — эти данные не нужны до следующего раза.
Это называется disk streaming. Умно, элегантно и, главное, работает.

Внутри GLM-5.2 есть 75 слоёв. В каждом слое — 256 «экспертов» (отдельных нейросетевых блоков). На каждый токен роутер выбирает примерно 8 экспертов на каждый слой из 256 доступных.
Colibri делит модель на две части:
| Часть | Что это | Где живёт | Размер |
|---|---|---|---|
| Dense stack | Базовая логика, внимание, эмбеддинги (~17B параметров) | Всегда в RAM | ~9.9 ГБ |
| Routed experts | 21 504 эксперта на диске | NVMe, стримятся по требованию | ~370 ГБ |
На каждый токен нужно прочитать с диска примерно 11 ГБ данных — именно нужные эксперты для нужных слоёв. Это и есть главный bottleneck: скорость диска определяет скорость генерации.
LRU-кэш — умная добавка. Часто используемые эксперты запоминаются в оставшейся RAM. Операционная система сама кэширует страницы файлов — как бесплатный второй уровень кэша. На машине с 430 ГБ RAM пользователи из сообщества достигли 98% попаданий в кэш — диск фактически перестаёт быть нужен.
После релиза пользователи HN начали делиться результатами на своих машинах:

| Машина | RAM / диск | Скорость |
|---|---|---|
| MacBook M5 Max | — / 14 ГБ/с SSD | 1.06 ток/с |
| EPYC 7443 (сервер, 430 ГБ RAM) | 430 ГБ / RAID NVMe | 1.00 ток/с, кэш 98% |
| Framework 13 | — / NVMe | 0.37 ток/с |
| Ryzen 9 9950X | — / PCIe 5.0 NVMe | 0.28 ток/с |
| Ноутбук автора (WSL2, 25 ГБ) | 25 ГБ / ~1 ГБ/с | 0.05-0.1 ток/с |
Для сравнения: комфортное чтение — это примерно 3-5 токенов в секунду. 1 ток/с — медленно, но уже можно работать. 0.05-0.1 — это очень медленно, буквально одно слово в 10-20 секунд.
Главный вывод: скорость диска важнее скорости CPU и тем более наличия GPU. Быстрый NVMe — ключевой параметр.

| Конфигурация | Ожидаемая скорость |
|---|---|
| PCIe 4.0 NVMe (~3-5 ГБ/с), 32 ГБ RAM | 0.5-1 ток/с |
| PCIe 5.0 NVMe или 2×NVMe RAID0, 64 ГБ RAM | 2-4 ток/с |
| 128-256 ГБ RAM (эксперты в кэше), 24+ ядра | 5-15 ток/с — комфортно |

Минимум:
Не нужно:

# 1. Скачать репозиторий
git clone https://github.com/JustVugg/colibri.git
cd colibri/c
# 2. Собрать и проверить
./setup.sh
# Ожидается: 32/32 тестов прошли
# 3а. Скачать готовые int4-веса (проще)
# → huggingface.co/jlnsrk/GLM-5.2-colibri-int4
# Нужно ~370 ГБ свободного места
# 3б. Или конвертировать самостоятельно (нужен Python один раз)
pip install torch safetensors huggingface_hub numpy
./coli convert --model /nvme/glm52_i4
# Resumable: если прервётся — продолжит с того же места
# 4. Запустить
COLI_MODEL=/nvme/glm52_i4 ./coli chatЗагрузка — около 30 секунд. Потом можно разговаривать.
Если хочешь подключить Colibri к своим инструментам (Claude Code через base_url, Cursor, Cline):
# Запустить локальный сервер
python c/openai_server.py
# В Claude Code
export ANTHROPIC_BASE_URL="http://localhost:8080/v1"Любой инструмент с поддержкой OpenAI API работает с локальным Colibri без изменений.
Весь движок: c/glm.c — примерно 2400 строк кода. Плюс несколько компактных хедеров для токенизатора, JSON и потоков.
Никаких зависимостей в рантайме. Никакого BLAS. Никакого Python. Gcc и OpenMP — и всё.
Это важно не только технически. Это означает, что любой, кто умеет читать C, может открыть файл и понять, как именно работает инференс 744B-модели. Никакого чёрного ящика — весь механизм перед глазами.
Именно за это Hacker News и дал #1: не за то, что быстро, а за то, что ясно и элегантно.
Максим: «Ребят, это работает — и меня зацепило не то, что можно запустить 744B на ноутбуке, а то, что один человек написал это за один файл на C. Это как сборник правил вайбкодинга в одном документе: максимум пользы, минимум лишнего. Мотаете на ус.»
Медленно на слабом железе. 0.05-0.1 ток/с на ноутбуке с 25 ГБ RAM — это не для интерактивной работы. Пишешь вопрос, ждёшь несколько минут ответа. Это proof-of-concept, а не рабочий инструмент для повседневного использования.
Диск — главный bottleneck. Если диск медленнее 5 ГБ/с случайного чтения — всё упирается в I/O. Старый SATA SSD или HDD не подойдут. Нужен именно NVMe.
GPU не поможет. Интуиция подсказывает: добавь GPU — станет быстрее. Нет. Эксперты стримятся через CPU по PCIe — GPU становится новым узким местом вместо диска. Colibri GPU-независим принципиально.
Качество int4 не измерено полностью. Квантизация модели до int4 теряет точность. Насколько — harness для измерения есть, но полный прогон занимает около дня. Публичных замеров качества пока нет.
Проект одного человека. Один разработчик, без команды. Быстро двигается, но на production-стабильность не рассчитан.
Colibri — не инструмент для ежедневной работы. Это архитектурный эксперимент, который доказывает важную вещь.
До сих пор считалось, что запустить модель уровня GLM-5.2 локально — нереально без дорогого серверного железа. Colibri показывает: нет, реально. Медленно, но реально. И с ростом скорости NVMe (PCIe 5.0 уже даёт 10+ ГБ/с) этот подход становится всё более практичным.
Сегодня disk-streaming MoE inference — экзотика. Через год-два, когда PCIe 5.0 станет стандартом в потребительском железе, а модели продолжат расти по размеру при той же спарсенности активаций — подход Colibri может оказаться основным способом запуска больших моделей без облака.
Colibri задаёт baseline: 744B на 25 ГБ RAM — возможно. Дальше — дело железа.
Нужен ли GPU для Colibri?
Нет. Принципиально не нужен. Всё работает на CPU. GPU добавление скорости не даёт из-за архитектуры disk-streaming.
Какой диск нужен?
NVMe, желательно PCIe 4.0 или 5.0. Для скорости 1+ ток/с нужно 5+ ГБ/с случайного чтения. Обычный SATA SSD или HDD — слишком медленно.
Сколько места нужно на диске?
Около 370 ГБ для int4-весов GLM-5.2. Плюс место для конвертации, если делаешь сам.
Это работает на Windows?
Да, через WSL2. Нативный Windows — тоже поддерживается (Windows 11).
Можно ли использовать с Claude Code или Cursor?
Да. В комплекте openai_server.py — локальный OpenAI-совместимый сервер. Указываешь base_url на localhost и используешь как обычный API.
Что такое int4-квантизация?
Это сжатие весов модели: вместо 16 или 32 бит на каждое число — только 4 бита. Модель занимает в 4-8 раз меньше места, но теряет немного точности. Насколько — в случае Colibri пока не измерено полностью.
Это безопасно? Данные уходят куда-то?
Нет. Всё локально. Никаких облаков, никаких API-ключей, никаких запросов во внешние сервисы. Модель работает полностью офлайн на твоей машине.
MoE (Mixture of Experts) — архитектура нейросети, где модель разбита на множество «экспертов». При обработке каждого токена активируется только небольшая часть из них. GLM-5.2: 744B параметров всего, ~40B активных на токен.
Disk streaming — подход, при котором части модели хранятся на диске и подгружаются в память только когда нужны. Позволяет запускать модели, которые не помещаются в RAM целиком.
LRU-кэш (Least Recently Used) — алгоритм кэширования: в памяти остаются те данные, которые использовались недавно. Давно неиспользованные вытесняются. В Colibri часто нужные эксперты остаются в RAM и не читаются с диска повторно.
Dense stack — постоянная часть модели в Colibri: attention, эмбеддинги, общие эксперты. Всегда в оперативной памяти (~9.9 ГБ).
Routed experts — специализированные блоки модели, которые активируются по выбору роутера. В Colibri хранятся на диске (~370 ГБ) и подгружаются по требованию.
int4-квантизация — сжатие весов нейросети с 16/32 бит до 4 бит на параметр. Размер уменьшается в разы, скорость растёт, точность немного падает.
AVX2 — набор инструкций процессора для параллельных вычислений. Поддерживается большинством процессоров Intel и AMD с 2013 года. Нужен для запуска Colibri.
Токен в секунду (ток/с) — стандартная метрика скорости языковых моделей. Примерно равен слову или части слова. Комфортное чтение — 3-5 ток/с. Интерактивная работа — от 1 ток/с.
MTP Speculative Decoding — оптимизация скорости: вспомогательная (меньшая) голова модели угадывает несколько следующих токенов, основная модель проверяет их за один проход. Принятые угадки ускоряют генерацию.
Репозиторий — github.com/JustVugg/colibri. Готовые веса — HuggingFace. Обсуждение на HN — 453 поинта. Архитектурный разбор — ChatForest.
Смотрите каталог AI-инструментов для локального запуска моделей на VibeCoderz.
Вопросы по локальным моделям и агентным пайплайнам — к Максиму.
Обновлено: июль 2026. Источники: GitHub, Hacker News, ExplainX, ChatForest.