Модель эмбеддингов выбирают не по месту в рейтинге, а по трем вещам: качеству на нужном языке, размерности вектора и стоимости при вашем объеме данных. Если вы уже понимаете, что такое эмбеддинги, и стоите перед конкретным вопросом «какую модель ставить в проект» — ниже пошаговый разбор с цифрами, а не абстрактный топ-5.
Модель эмбеддингов в 2026 году — это выбор между платным облачным API (OpenAI text-embedding-3) и открытыми моделями Sentence Transformers для локального запуска. Разница в цене — от $0.02 до $0.13 за миллион токенов у OpenAI против бесплатного self-host. В статье: три критерия выбора, сравнение по русскому языку и таблица «что взять под какой сценарий».
Зачем вообще выбирать модель, если можно взять лидера рейтинга?
Топ лидерборда не учитывает вашу нагрузку. Модель на пару позиций ниже может оказаться дешевле в 8 раз и быстрее при том же качестве.
Размерность вектора — параметр, который чаще всего недооценивают при первом выборе модели. У одних моделей вектор содержит 384 числа, у других 3072: разница в восемь раз, и она напрямую бьет по стоимости хранения и скорости поиска. При этом прирост качества между такими моделями на общих бенчмарках часто укладывается в пару процентов.
Сравнение моделей эмбеддингов по общему лидерборду вроде MTEB — только стартовая точка. Разработчики, которые тестировали это на практике, отмечают: модель на 3-4 строчки ниже в рейтинге, но с меньшей размерностью и большей пропускной способностью, часто оказывается удобнее в проде, чем формальный лидер.
Проверено на своем опыте: смена модели эмбеддингов после запуска — это не апдейт одной строчки в конфиге. Придется пересчитать эмбеддинги для всего корпуса заново, потому что векторы разных моделей живут в несвязанных пространствах и напрямую не сравниваются между собой.

Какие параметры реально влияют на выбор embedding-модели?
Три параметра решают почти все: качество на языке ваших данных, размерность вектора и стоимость при масштабе. Остальное — детали конкретной задачи.
Три критерия закрывают 90% решения. Разберем каждый по отдельности, потому что смешивать их в одну общую оценку — типичная ошибка новичков.
Качество на нужном языке. Модель, которая отлично работает на английском, на русском может проседать заметно: доля русскоязычных данных в обучающей выборке у большинства провайдеров меньше. Для проекта с русским контентом это важнее, чем общий рейтинг на англоязычных бенчмарках.
Размерность вектора. Больше измерений — точнее нюансы смысла, но дороже хранение и медленнее поиск. На миллионах документов разница между 384 и 1536 измерениями — это разница в десятки гигабайт векторной базы.
Стоимость и способ запуска. Платный облачный API против бесплатной открытой модели на своем сервере. Тут выбор завязан не на качестве, а на объеме данных и требованиях к приватности.
| Параметр | На что влияет | Что проверить перед выбором |
|---|---|---|
| Язык данных | Качество поиска и релевантность | Тест на своих текстах, не только по рейтингу |
| Размерность вектора | Стоимость хранения, скорость поиска | Поддержка усечения (truncation) без потери качества |
| Способ запуска | Бюджет, приватность, риск миграции | Облако вs self-host под ваш объем |
| Лимит токенов | Не потеряются ли данные при обрезке чанка | Длина реальных чанков в токенах модели |

OpenAI text-embedding-3 или Sentence Transformers: что выбрать?
Для быстрого старта без своей инфраструктуры — платный OpenAI API. Для больших статичных объемов данных или требований к приватности — открытые модели Sentence Transformers на своем сервере.
По состоянию на сентябрь 2026 OpenAI text-embedding-3-small стоит $0.02 за миллион токенов, а text-embedding-3-large — $0.13 за миллион. Для сравнения: индексация 10 000 документов по 500 токенов обойдется в 10 центов на small-модели. Это дешевле одного дня обычного чата с GPT.
Sentence Transformers — открытое семейство моделей, которое можно запускать локально без платы за каждый вызов. Среди них есть модели, заточенные специально под многоязычные задачи, включая русский. Разница в подходе простая: у OpenAI платишь за токен и не думаешь про сервер, у Sentence Transformers платишь один раз за вычислительные ресурсы и не зависишь от чужого API.
Максим: «Я уверен полностью, что языки программирования вообще не нужно изучать. Нейросети обучены на 80+ языках. Нужно погружаться в архитектуру: фронт, бэк, база данных.» Та же логика с эмбеддингами: не зубрите формулы, разберитесь, что вектор реально делает в вашем пайплайне.
| Критерий | OpenAI text-embedding-3-small | OpenAI text-embedding-3-large | Sentence Transformers (self-host) |
|---|---|---|---|
| Цена | $0.02 / 1M токенов | $0.13 / 1M токенов | Бесплатно, платите за сервер |
| Размерность | 1536 (с усечением) | 3072 (с усечением) | Зависит от модели, часто 384–1024 |
| Контекст | 8191 токенов | 8191 токенов | Зависит от модели |
| Русский язык | Хорошо | Хорошо | Есть специализированные модели |
| Инфраструктура | Не нужна | Не нужна | Своя, GPU или CPU |
Как размерность вектора влияет на стоимость и скорость?
Разница между 384 и 3072 измерениями — восьмикратная. При 20 миллионах чанков это счет на дни хранения и обработки, а не на секунды.
Сравнение выбора модели эмбеддингов часто сравнивают с выбором типа столбца в базе данных: решение кажется мелким технически, но откликается на всей архитектуре позже. При 20 тысячах чанков разница в размерности почти незаметна. При 20 миллионах — это уже вопрос инфраструктурного бюджета.
Некоторые модели поддерживают усечение вектора (truncation) без существенной потери качества. Это ценнее небольшого прироста в бенчмарке, потому что дает гибкость менять размер вектора позже, не переделывая весь пайплайн заново.
Отдельно проверяйте лимит токенов модели против фактической длины ваших чанков. Часть моделей молча обрезает текст, который не влезает в лимит, без явной ошибки. Данные теряются тихо, и находится это уже на этапе разбора багов в поиске.

Что будет, если сменить модель эмбеддингов позже?
Смена модели требует пересчитать эмбеддинги для всего корпуса. Векторные пространства разных моделей не совместимы между собой.
Ре-эмбеддинг всего корпуса — не опция, а обязательный шаг при смене модели. Векторы от разных моделей похожи на двух людей, описывающих одну комнату на разных языках: числа не переводятся друг в друга напрямую.
Для хостинговых моделей есть дополнительный риск: провайдер может задепрекейтить версию, и миграция станет вынужденной, а не плановой. Для больших статичных корпусов, которые редко обновляются, self-host снимает этот риск полностью — вы сами решаете, когда обновлять модель.

Как проверить качество модели на русском языке?
Общие бенчмарки не гарантируют качество на конкретном языке. Тестируйте на своих данных и реальных запросах пользователей, а не только на лидерборде.
Для русского языка есть отдельный бенчмарк ruMTEB, который тестирует модели именно на репрезентации русскоязычных текстов, а не берет общий английский рейтинг за универсальный ориентир. Это первая точка проверки перед выбором.
Вторая точка — собственный тест. Возьмите реальные запросы из логов, вручную разметьте правильные ответы и прогоните через кандидатов на роль модели. Общий рейтинг на английском не гарантирует такого же качества на русском тексте: доля русскоязычных данных в обучении у моделей разная, и это напрямую видно на нечетких формулировках и профессиональном сленге.
Обратите внимание и на тип обучения модели: одни оптимизированы под симметричную близость (дедупликация похожих текстов), другие — под пары вопрос-ответ. Для поисковика по документации нужен второй тип, для поиска дублей — первый.

Кому подходит облачный API, а кому self-host?
Облачный API подходит для быстрого старта и небольших объемов. Self-host выгоднее на больших статичных корпусах и при требованиях к приватности данных.
Карта выбора получается простой, если разложить по трем сценариям.
- Быстрый старт, MVP, до нескольких миллионов токенов в месяц — берите OpenAI text-embedding-3-small. Не нужна инфраструктура, цена почти не ощущается.
- Большой объем данных, который редко меняется — считайте self-host на Sentence Transformers. При миллионах чанков плата за каждый вызов API складывается в заметную статью расходов.
- Требование держать данные внутри своей инфраструктуры — только self-host. Российские компании часто приходят к этому решению не из-за цены, а из-за требований к хранению данных.

Итог: как выбрать модель эмбеддингов под свою задачу
Три шага без лишней теории. Первый — протестируйте кандидатов на своих данных, а не по общему рейтингу. Второй — посчитайте стоимость хранения векторов при том объеме, который у вас будет через год, а не сейчас. Третий — проверьте лимит токенов и длину реальных чанков, чтобы не терять данные на молчаливой обрезке.
Если вы уже собираете базу знаний для RAG-проекта, эта же логика применима к выбору векторной базы данных — размерность вектора модели напрямую определяет требования к хранилищу. А если хотите развернуть весь стек локально, посмотрите разбор локального AI-стека на Ollama.
Глоссарий
- Эмбеддинг (embedding) — числовое векторное представление текста, которое отражает его смысл.
- Размерность вектора — количество чисел в векторе эмбеддинга. Чем больше, тем точнее нюансы смысла и тем дороже хранение.
- Усечение вектора (truncation) — сокращение размерности готового эмбеддинга без пересчета с нуля.
- RAG (Retrieval-Augmented Generation) — архитектура, где модель ищет релевантные фрагменты текста перед генерацией ответа.
- ruMTEB — бенчмарк для оценки эмбеддинг-моделей на русскоязычных текстах.
- Self-host — запуск модели на собственном сервере вместо облачного API.
Частые вопросы про выбор модели эмбеддингов
Какая модель эмбеддингов лучше всего работает на русском языке?
Однозначного лидера нет: результат зависит от типа текста. Проверяйте кандидатов по бенчмарку ruMTEB и обязательно тестируйте на своих данных, потому что общий рейтинг на английском не гарантирует такое же качество на русском.
OpenAI embeddings или Sentence Transformers — что дешевле?
Для небольших объемов дешевле OpenAI text-embedding-3-small: $0.02 за миллион токенов почти не ощущается в бюджете. На десятках миллионов чанков self-host на Sentence Transformers обычно выгоднее, потому что вы платите один раз за сервер, а не за каждый вызов.
Можно ли поменять модель эмбеддингов после запуска проекта?
Можно, но придется пересчитать эмбеддинги для всего корпуса заново. Векторные пространства разных моделей не совместимы, поэтому частичная замена не работает.
Что важнее: размерность вектора или место в рейтинге модели?
При небольшом объеме данных разница почти не заметна. При миллионах чанков размерность вектора напрямую определяет стоимость хранения и скорость поиска, и это часто важнее пары процентов в бенчмарке.
Как проверить, что модель не обрезает длинные тексты молча?
Сравните лимит токенов модели с реальной длиной ваших чанков перед индексацией. Часть моделей усекает входные данные без ошибки, и это нужно встраивать в проверку на этапе пайплайна, а не искать потом в багах поиска.
Нужна ли своя инфраструктура для запуска эмбеддингов?
Для облачного API вроде OpenAI — нет, платите за токены. Для self-host на Sentence Transformers нужен сервер с CPU или GPU для генерации векторов, зато нет платы за каждый запрос.
Какой тип модели выбрать для поиска по документации?
Модели, обученные на парах вопрос-ответ, а не на симметричной близости. Симметричные модели лучше подходят для поиска дублей текста, а не для ответа на вопрос по базе знаний.
Источники: OpenAI Embeddings — официальная документация, Sentence Transformers (SBERT), ruMTEB — бенчмарк эмбеддингов для русского языка.
Каталог AI-инструментов для вайбкодинга — на странице всех IDE и сервисов. Если нужен разбор архитектуры конкретно под ваш проект — запишитесь на консультацию к Максиму.
Обновлено: сентябрь 2026.