Mercury 2.5 выдаёт 1107 токенов в секунду: что это меняет для AI-креатора
Компания Inception выпустила Mercury 2.5 — языковую модель на диффузионной архитектуре, которая выдаёт 1107 токенов в секунду. Это в несколько раз быстрее большинства авторегрессивных моделей при сопоставимом качестве текста. Для AI-креаторов, которые генерируют промпты, сценарии и описания в потоке, скорость напрямую влияет на темп работы.
Что такое Mercury 2.5 и при чём тут диффузия
Большинство языковых моделей — авторегрессивные: они генерируют текст слово за словом, каждый токен зависит от предыдущего. Mercury 2.5 устроен иначе — это диффузионная языковая модель (dLLM). Вместо последовательного вывода она уточняет весь текст итерационно, как диффузионные модели уточняют изображение из шума.
Такой подход позволяет распараллелить вычисления и кратно увеличить скорость вывода. Именно поэтому цифра в 1107 токенов в секунду достижима без специального железа или многомиллиардных инфраструктурных затрат.
Mercury 2.5 — не первая модель Inception: до неё выходила Mercury 1.0. Версия 2.5 улучшает скорость, расширяет контекст и снижает цену входа.
1107 токенов в секунду: что это значит на практике
Для сравнения: GPT-4o выдаёт около 70–100 токенов в секунду в стандартном режиме, Claude 3.5 Sonnet — около 80–120. Mercury 2.5 работает в 10–15 раз быстрее.
Что это меняет для AI-креатора:
- Промпты для изображений. Если ты генерируешь по 30–50 промптов за сессию, ждать их оформления не придётся — модель успевает, пока ты переключаешься между вкладками.
- Сценарии для Reels и Shorts. Полный сценарий на 60 секунд — около 300–400 слов. Mercury 2.5 выдаёт это за доли секунды.
- Пакетная генерация описаний. Если нужно сгенерировать 100 alt-текстов к AI-фото или 50 вариантов подписей — скорость становится критичной.
- Интерактивные инструменты. Если встраивать модель в собственный пайплайн через API, задержки практически исчезают, интерфейс ощущается мгновенным.
Диффузионная архитектура влияет не только на скорость, но и на характер генерации: модель лучше держит структуру длинного текста, потому что «видит» его целиком, а не строит линейно. Это заметно при работе со сложными промптами для Syntx AI и аналогичных платформ, где промпт должен учитывать сразу несколько переменных — стиль, освещение, ракурс, настроение.
260 000 токенов контекста: для каких задач это нужно
260K токенов — это примерно 200 000 слов, или около 400 страниц текста. Большинство рабочих задач AI-креатора не требует такого объёма, но ряд сценариев становится возможен именно с таким окном.
Длинные референсные документы
Если ты работаешь с брендбуком, стайлгайдом или базой промптов на сотни позиций — весь документ помещается в контекст целиком. Не нужно дробить его на части или делать ретривл через векторную базу.
История проекта
Для AI-сериала или долгосрочного контент-проекта можно держать всю историю персонажей, описания локаций и уже сгенерированные сцены в одном контексте. Модель будет учитывать их при написании следующих эпизодов без повторного объяснения.
Анализ видеосценариев
Полный сценарий полнометражного фильма — около 100–120 страниц, или 70–80K токенов. В 260K влезает несколько таких сценариев одновременно: удобно для анализа структуры, адаптации или генерации по образцу.
Цены на старте
Inception позиционирует Mercury 2.5 как доступную модель для разработчиков и команд. Конкретные цифры на момент запуска — низкие относительно конкурентов в том же классе производительности. Модель доступна через API, что позволяет встраивать её в собственные продукты и пайплайны.
Для AI-креатора это означает: если ты используешь сторонние инструменты или собираешь собственный рабочий процесс, Mercury 2.5 может оказаться экономически выгоднее, чем вызовы GPT-4o или Claude при аналогичном объёме запросов.
Важно учитывать, что диффузионные модели пока уступают лучшим авторегрессивным в ряде задач — особенно там, где важны нюансы логики, сложные рассуждения или точные инструкции. Для генерации промптов, описаний и текстов под контент Mercury 2.5 подходит хорошо. Для замены GPT-4o в задачах с кодом или сложной аналитикой — стоит проверять на конкретных кейсах.
Выводы
- Mercury 2.5 выдаёт 1107 токенов в секунду — это реально ощутимо при пакетной генерации промптов, сценариев и описаний.
- Диффузионная архитектура позволяет лучше держать структуру длинного текста, что полезно для сложных промптов и многосцентных сценариев.
- Контекст 260K токенов закрывает задачи с длинными референсами и историей проекта без дополнительных ухищрений.
- Модель доступна через API по конкурентным ценам — имеет смысл протестировать в собственном пайплайне.
- Для задач с логикой и рассуждениями лучше сравнивать с GPT-4o или Claude на реальных примерах перед внедрением.