Дифференциальная приватность (Differential Privacy, DP) — это математическая концепция, обеспечивающая защиту индивидуальных данных при анализе больших массивов информации. Основная цель DP — позволить извлекать полезные статистические сведения, одновременно минимизируя риск раскрытия конкретных элементов исходного набора данных.
Дифференциальная приватность задается через два параметра: ε (эпсилон) и δ (дельта). Формально, алгоритм ( ) является ((, ))-дифференциально приватным, если для любых соседних наборов данных (D) и (D’), отличающихся только одним элементом, выполняется:
[ e^+ ]
где (S) — любое множество возможных выходных значений алгоритма.
Добавление шума (Noise Injection) Один из центральных методов DP — добавление случайного шума к результатам вычислений. Наиболее часто применяются распределения:
Чувствительность функции (Sensitivity) Чувствительность ( f ) функции ( f ) определяется как максимальное изменение её значения при изменении одного элемента данных:
[ f = _{D, D’} | f(D) - f(D’) |]
Добавляемый шум пропорционален чувствительности и обратно пропорционален параметру ε:
[ (0, f / )]
Композиция и бюджет приватности При многократном использовании DP-алгоритмов суммарная утечка приватности накапливается. Для последовательного применения алгоритмов DP применяется теорема композиции, которая позволяет вычислять итоговые параметры ((, )) системы. Существуют строгие и усовершенствованные методы композиции (например, продвинутая композиция, Moments Accountant).
В контексте TensorFlow.js дифференциальная приватность применяется для обучения моделей, где данные пользователей остаются конфиденциальными. Основная идея заключается в модификации алгоритма градиентного спуска:
DP-SGD (Differentially Private Stochastic Gradient Descent):
Это позволяет модели обучаться на данных, не раскрывая конкретные примеры пользователей.
TensorFlow Privacy: библиотека, совместимая с TensorFlow и TensorFlow.js, предоставляющая инструменты для DP-SGD.
Настройка гиперпараметров DP:
noiseMultiplier — коэффициент, определяющий величину
шума.l2NormClip — параметр для обрезки градиентов.microbatches — количество мини-батчей, на которых
считается градиент с шумом.Оценка приватности:
computeDP — функция для вычисления итоговых ε и δ после
нескольких шагов обучения.Эти принципы формируют основу понимания дифференциальной приватности и её практической реализации в современных проектах машинного обучения.