Эволюция генерации текста: Multi-Mask Diffusion и прорыв в скорости
overloaded AI 的 AI API 使用建议
overloaded AI 面向需要 OpenAI 兼容接口、Claude/Gemini/GPT 多模型切换、包月额度管理和图像模型调用的用户。阅读本文后,可以结合本站的模型清单、独立使用文档和个人面板,把教程内容直接落到实际调用流程中。
В мире современных нейросетей доминируют авторегрессионные модели (как GPT), которые генерируют текст слово за словом. Однако диффузионные языковые модели (Masked Diffusion Models, MDM) представляют собой мощную альтернативу, предлагая иную парадигму создания контента. Несмотря на их потенциал, долгое время камнем преткновения оставалась скорость: качественная генерация требовала слишком много шагов.
В новой исследовательской работе «Multi-Mask Diffusion Language Models for Few-Step Generation», представленной на конференции COLM 2026, ученые предложили инновационный подход под названием MultiMDM, который обещает изменить правила игры.

Проблема стандартных маскированных моделей
Классические маскированные диффузионные модели работают по принципу постепенного «размытия» текста: чистые токены заменяются на специальный токен [MASK]. В процессе обратной диффузии модель пытается восстановить исходный текст из полностью замаскированного состояния.
Основная проблема заключается в том, что в стандартных MDM все пути ведут к одному и тому же состоянию — полной маскировке. Это создает «узкое горлышко» при попытке ускорить процесс до нескольких шагов (few-step generation), так как теряется необходимая энтропия для качественного восстановления данных.
Инновация: Мульти-маскирование (Multi-Mask)
Команда исследователей (Sijin Chen и др.) предложила архитектуру MultiMDM. Основная идея заключается в использовании набора различных масок вместо одной универсальной.
Как это работает?
- Прямой процесс: Каждый токен сначала переходит в специально назначенную ему маску, а затем постепенно смешивается с общим набором масок. Это сохраняет структуру данных даже на глубоких этапах зашумления.
- Обратный процесс (Генерация): Модель получает способность к «черновому наброску» (drafting). Она сначала предсказывает конкретную маску, а затем уточняет ее до чистого токена.
Такой двухэтапный подход внутри одного процесса диффузии позволяет значительно повысить точность при малом количестве шагов генерации.
Технические преимущества MultiMDM
Разработка включает в себя несколько важных математических и инженерных достижений:
- Целевая функция ELBO в замкнутой форме: Это позволяет эффективно обучать модель с нуля или продолжать обучение уже существующих предобученных MDM (continual training), что экономит огромные вычислительные ресурсы.
- Дискретная дистилляция (Consistency Distillation): Авторы разработали схему дистилляции для дискретных состояний, используя метод сопряжения Gumbel (shared-Gumbel coupling). Это минимизирует «хаос» при переходе между шагами и делает генерацию более стабильной.
Почему это важно для будущего AI?
Переход от сотен шагов генерации к считанным единицам без потери качества открывает двери для:
- Мгновенных чат-ботов: Снижение задержки ответа (latency) в разы.
- Экономии ресурсов: Меньше вычислений означает меньшие затраты на GPU и электроэнергию.
- Новых архитектур: MultiMDM доказывает, что диффузионные модели могут конкурировать с GPT не только в гибкости, но и в эффективности.
Исследование MultiMDM закладывает прочный фундамент для создания нового поколения быстрых и эффективных языковых моделей, способных генерировать сложный контент практически мгновенно.
Основано на материалах статьи arXiv:2607.19686 [cs.CL].