Конспекты
Смарт-конспекты YouTube-видео — ключевые идеи и инсайты без необходимости смотреть часовые ролики
Загрузка...
Смарт-конспекты YouTube-видео — ключевые идеи и инсайты без необходимости смотреть часовые ролики
Узнайте, как использовать Multi-Token Prediction (MTP) в Llama CPP для ускорения локальных моделей Qwen и Deepseek на 25% без потери точности.
Маркетинг-стратег, IT-предприниматель, ментор по вайбкодингу
10+ лет в маркетинге, 300+ клиентских проектов: сайты, реклама, боты. Создатель GoBanana (228K+ пользователей, 11.6 млн ₽ выручки) и VibeCoderz. Делаю AI-продукты сам через Claude Code, Cursor, Windsurf и консультирую тех, кто хочет так же.
Об авторе →Open Code: Полный гид по бесплатному open-source AI-агенту для кодинга
Узнайте, как использовать Open Code — бесплатный open-source AI-агент. Установка, настройка моделей (DeepSeek, GPT), режимы Plan/Build и создание Kanban-аппа.
DeepSeek V4 в Claude Code: Как экономить на токенах в 10 раз и обходить лимиты
Пошаговый гид по интеграции DeepSeek V4 в Claude Code. Установка DeepSeek TUI, настройка VS Code и стратегия экономии токенов в 10 раз.
Claude Code + DeepSeek V4: Как кодить в 100 раз дешевле
Пошаговое руководство по интеграции DeepSeek V4 в Claude Code. Экономия на API, стратегия Dual Terminal и создание сайтов с помощью AI-агентов.
Claude Code + Ollama Cloud: Как бесплатно использовать топовые LLM без лимитов
Инструкция по настройке Claude Code с облачными моделями Ollama. Бесплатный доступ к DeepSeek и MiniMax для кодинга без мощной видеокарты.
DeepSeek-V2.7: Полный разбор самоулучшающейся модели для вайбкодинга
Анализ DeepSeek-V2.7: как работает цикл самообучения, тесты в кодинге и дизайне, сравнение цен и эффективности для AI-агентов.
Zcode AI: Полный гид по визуальному интерфейсу для Claude Code и AI-агентов
Узнайте, как использовать Zcode для управления Claude Code, Gemini и Codex в едином GUI. Настройка провайдеров, MCP-серверов и визуальный вайбкодинг.
🎯 О чём этот конспект: Разбор технологии Multi-Token Prediction (MTP), которая недавно была добавлена в Llama CPP. Это программное улучшение позволяет значительно увеличить скорость генерации текста (TPS) на локальном железе без использования дополнительных "черновых" моделей.
👤 Кому будет полезно: Вайбкодерам и разработчикам, запускающим модели локально через Llama CPP, LM Studio или Anything LLM и желающим выжать максимум производительности из своего GPU/CPU.
✨ Что получите: Пошаговую инструкцию по настройке MTP, понимание того, какие модели поддерживают эту фичу, и как правильно подобрать параметры, чтобы не замедлить, а ускорить инференс.
Контекст: Традиционно LLM предсказывают один следующий токен за раз. Существует метод Speculative Decoding (спекулятивное декодирование), где маленькая модель-черновик предсказывает токены быстрее, а большая их проверяет. Однако это требует загрузки двух моделей в память, что критично для локальных систем. MTP — это эволюция идеи: теперь одна и та же модель может предсказывать несколько токенов вперед одновременно. Это дает "бесплатный" прирост скорости без потери точности ответов.
Тайминг: [00:33], [01:47], [03:03]
Выгода: Прирост скорости генерации до 25% и выше на том же железе.
Как применить:
MTP на HuggingFace.Результат: Увеличение количества токенов в секунду (TPS) при сохранении исходного качества модели.
Контекст: Не каждая модель может использовать MTP. Технология должна быть внедрена на этапе обучения. Автор перечисляет ключевые семейства моделей, которые уже поддерживают этот функционал в формате GGUF.
Тайминг: [03:39], [04:04]
Список поддерживаемых моделей:
Важное замечание по MoE (Mixture of Experts): Для моделей типа MoE (например, Qwen 122B) прирост может быть менее заметным или отсутствовать вовсе. Лучшие результаты MTP показывает на Dense (плотных) моделях.
Контекст: Для запуска недостаточно просто обновить софт. Нужно использовать специфические флаги в командной строке, чтобы указать Llama CPP, сколько токенов предсказывать наперед.
Тайминг: [05:52], [07:45]
Как применить: Используйте следующие аргументы при запуске сервера или исполняемого файла Llama CPP:
# Пример команды запуска с MTP
./llama-server -m qwen3.5-9b-mtp-q4_k_m.gguf \
--draft-mtp \
--draft-n-max 1Разбор параметров:
--draft-mtp: Активирует режим Multi-Token Prediction.--draft-n-max [число]: Определяет, на сколько токенов вперед модель будет пытаться "заглянуть".Результат: Если всё сделано правильно, модель загрузится с новыми тензорами и начнет генерацию с использованием спекулятивного метода внутри одной архитектуры.
Контекст: Самая частая ошибка — выставить слишком большое значение предсказания (например, 6 токенов). Автор наглядно показывает на бенчмарках, что при слишком высоком значении n-max скорость падает ниже базовой.
Тайминг: [08:05], [08:40]
Результаты тестов автора (Qwen 3.5 9B на M4 Pro):
Как применить:
--draft-n-max 1. Это самый безопасный вариант, дающий стабильный прирост.n=2 или n=3. Если TPS растет — оставляйте. Если падает — возвращайтесь к n=1.Результат: Оптимизированная скорость генерации, подобранная под ваше конкретное оборудование.
В: Можно ли использовать MTP со старыми GGUF файлами? О: Нет. Старые квантования не содержат необходимых данных (тензоров) для предсказания нескольких токенов. Вам нужно заново скачать модель с пометкой MTP (например, от Unsloth).
В: Будет ли работать MTP в LM Studio или Anything LLM? О: Да, как только эти приложения обновят встроенный движок Llama CPP до последней версии. В Anything LLM поддержка появляется очень быстро, так как автор видео является его создателем.
В: Влияет ли MTP на точность ответов (галлюцинации)? О: Нет. Это чисто архитектурное ускорение процесса генерации. Если предсказанные токены не проходят проверку основной логики модели, они отбрасываются и пересчитываются. Результат идентичен работе без MTP.
В: Работает ли это с Vision-моделями? О: Да, MTP поддерживает визуальный ввод, хотя на этапе обработки промпта (prompt processing) может быть небольшая задержка, которая будет оптимизирована в будущих обновлениях.
В: Нужно ли больше видеопамяти (VRAM) для MTP? О: Накладные расходы по памяти минимальны. Если модель влезает в вашу память сейчас, она влезет и с активированным MTP. Это гораздо экономнее, чем классический Speculative Decoding с двумя моделями.
https://useanything.com/https://github.com/ggerganov/llama.cpphttps://huggingface.co/unslothупомянуты в видеоупомянуты в видеоКонспект создан на основе видео «Multi-Token Prediction is FINALLY in Llama.cpp (25%+ Speed Increase)» канала Timothy Carambat. Все права на оригинальный материал принадлежат авторам. Источник: https://youtu.be/hAHFENCe59M