Словарь
Диффузионная модель
Диффузионная модель — тип нейросети, которая создаёт звук или изображение, постепенно превращая шум в сигнал. Простое объяснение принципа.
Диффузионная модель — класс генеративных нейросетей, которые создают результат, постепенно превращая случайный шум в осмысленный сигнал. Именно на них построена большая часть современной генерации изображений, а всё чаще — и звука с музыкой.
Как это работает (без формул)
Обучение идёт «наоборот». Модели берут чистые примеры и пошагово добавляют к ним шум, пока не останется каша, — и учат сеть предсказывать, как убрать шум на каждом шаге. После обучения процесс запускают с конца: из чистого шума модель шаг за шагом «вытягивает» правдоподобный результат, направляемый текстовым запросом.
Отсюда характерная черта: генерация занимает несколько шагов и вычислительно дороже, чем распознавание. И отсюда же — почему генерация музыки появилась позже шумоподавления: создавать сложнее, чем восстанавливать.
Почему это важно отличать
Диффузионная модель создаёт сигнал, которого не было, — в отличие от шумодава, который восстанавливает записанное. Эта граница определяет, где инструментом можно пользоваться свободно, а где возникают вопросы авторских прав на обучающие данные и на результат. Тот же принцип «из шума в сигнал» лежит и за частью инструментов разделения на стемы.