Яндекс нашёл способ навсегда "впечатать" команды в память ИИ — нейросети больше не будут страдать провалами
Проблема «катастрофического забывания» долгое время оставалась одним из главных камней преткновения в развитии голосовых ассистентов, работающих в условиях ограниченных вычислительных мощностей. Суть её проста и коварна: когда модель обучают новым голосовым командам, она с высокой вероятностью «забывает» старые, так как её веса перестраиваются для распознавания новых паттернов. Исследователи Яндекса, судя по всему, нашли элегантное решение, которое может кардинально изменить подход к обновлению встроенного ПО в умных устройствах.
Вместо того чтобы пытаться «переучить» огромную нейросеть, инженеры компании предложили модульную архитектуру. К уже работающей базовой модели просто добавляется небольшой дополнительный модуль — отдельная обучаемая ветка, отвечающая исключительно за новые команды. Этот модуль использует промежуточные данные, которые извлекает основная сеть, но имеет собственный классификатор для новых фраз -3-4-8. При этом параметры основной модели остаются замороженными и неизменными. Это означает, что качество распознавания уже знакомых фраз гарантированно не ухудшается, так как система для них остаётся прежней, а новые знания просто «надстраиваются» сверху. Такой подход не только решает проблему забывания, но и оказывается крайне эффективным с вычислительной точки зрения — итоговый рост размера модели составляет менее 10% -1-3-6, что критически важно для устройств с ограниченными ресурсами, таких как умные колонки или автомобильные ассистенты.
Эффективность метода уже подтверждена экспериментально. Испытания на открытом наборе данных Google Speech Commands показали впечатляющие результаты. Средняя доля пропущенных новых команд снизилась почти на треть — с 6,46% до 4,37% -1-3-8. Для сравнения, при классическом полном дообучении модели, хотя она и усваивала новые команды, распознавание старых ухудшалось катастрофически: доля пропущенных команд среди уже известных возрастала с 2,71% до 69,08% -3-4. Это наглядно демонстрирует, что «классический» путь развития интеллекта ведёт в тупик, в то время как модульное расширение позволяет наращивать функциональность без потери накопленного опыта. Разработка уже получила признание профессионального сообщества — исследование приняли на международную конференцию Interspeech 2026, которая пройдёт в Сиднее -3-4-10.
Важно отметить, что речь идёт о ключевой технологии для работы устройств в офлайн-режиме. Именно локальное распознавание ключевых слов (триггеров) позволяет колонке или автомобильному ассистенту «просыпаться» по голосовой команде, не отправляя каждый звук в облако. Возможность добавлять новые триггеры (например, новые имена для устройств или новые команды управления) «на лету» без риска сломать существующую логику — это то, чего долго ждал рынок -4-8. В перспективе это позволит производителям выпускать обновления, добавляющие новые голосовые сценарии даже для устройств, выпущенных несколько лет назад, без необходимости перепроектирования аппаратной части. В сочетании с недавними нововведениями, такими как понимание разговорной речи для управления умным домом -2-11 и функция «Непрерывный диалог» -7, эта технология делает взаимодействие с «Алисой» и её «коллегами» ещё более естественным и интеллектуальным.