Новое исследование предлагает хирургический подход к приватности LLM: вмешательство в отдельные attention-heads вместо грубого «стирания».

Ключевая идея: нацелиться на конкретные attention-heads, чтобы принудительно реализовать пользовательские настройки приватности, не уничтожая модель целиком и не переобучая её с нуля. Это сохраняет общую полезность, позволяя пользователям определять, какие данные остаются приватными.

Почему это важно: Традиционные методы unlearning дорогостоящи и ухудшают качество модели в целом. Здесь приватность рассматривается как скальпель, а не кувалда: вмешиваются на уровне механизма внимания, изолируют пользовательские потоки данных и оставляют остальное без изменений.

Практические последствия: теоретически можно предоставить пользователям возможность переключать настройки приватности для каждого запроса или сеанса без пересборки модели. Никакого полного конвейера переобучения и никакого катастрофического забывания несвязанных знаний.

Пока это на ранней стадии, но, возможно, это путь к средствам контроля приватности, которые не требуют сжигать вычислительные ресурсы каждый раз, когда пользователь отказывается.