Обезличивание данных для ИИ по 152-ФЗ: как использовать нейросети с персональными данными

Практика BoostBot: как мы обезличиваем персональные данные клиентов перед отправкой в языковые модели.
Когда голосовой или текстовый ИИ-агент работает с клиентами, часть обработки уходит во внешние языковые модели (LLM). Большинство сильных языковых моделей расположены на серверах за пределами РФ. Если отправлять туда персональные данные российских клиентов напрямую, это нарушает 152-ФЗ. Решение — обезличивание: перед отправкой в нейросеть персональные данные заменяются на маркеры, а на нашей стороне подставляются обратно. Клиент получает нормальный ответ с реальными именами и деталями, а полные персональные данные физически не покидают контур российской инфраструктуры. Разберем, как это устроено на практике.
Что закон считает персональными данными
По статье 3 152-ФЗ, персональные данные — это «любая информация, относящаяся к прямо или косвенно определенному или определяемому физическому лицу». В клиентском диалоге это:
ФИО пациента или клиента;
номер телефона, email;
адрес места жительства;
дата рождения, номер полиса, номер записи;
диагноз, услуга, финансовая операция — это специальные категории по статье 10, требуют повышенной защиты.
Первичная база с этими данными по статье 18.1 должна храниться в РФ. Передача в зарубежный публичный API без согласия субъекта и уведомления Роскомнадзора (статья 12) считается нарушением. Значит, для использования зарубежных нейросетей данные нужно предварительно обезличить.
Как мы это делаем: замена на маркеры
Идея простая: до того, как отправить текст диалога в LLM, все идентифицирующие поля заменяются на нейтральные маркеры вида «Пациент 1», «Телефон 1», «Диагноз 1». Модель работает с обезличенным контекстом. Ответ возвращается с теми же маркерами, и на нашей стороне они подставляются обратно на реальные значения. Клиент этой замены не видит. Полный процесс из четырех шагов:
Шаг 1. Классификация входящих данных
На вход приходит текст диалога или расшифровка голоса. Автоматический скрипт (регулярные выражения плюс NER-модель, обученная на русскоязычных персональных данных) находит имена, телефоны, адреса, номера документов, диагнозы, суммы операций.
Шаг 2. Замена на маркеры
Найденные персональные данные заменяются на плейсхолдеры: ФИО → «Пациент 1», телефон → «Телефон 1», адрес → «Адрес 1», номер записи или полиса → «Запись 1», диагноз → «Диагноз 1» (или группа МКБ, если нужен только общий контекст). Таблица соответствия «маркер → исходное значение» хранится в локальной базе на защищенном сервере в РФ и никогда не покидает наш контур.
Шаг 3. Отправка обезличенного текста в LLM
Во внешний API уходит уже стерильный вариант диалога, без прямых идентификаторов. Пример.
Реальный диалог (то, что было в базе клиента):
«Здравствуйте, Иван Петрович. Ваша запись на завтра на МРТ головного мозга в 15:30. Телефон для связи: 8-999-123-45-67. Подтверждаете запись?»
Что уходит в LLM после замены:
«Здравствуйте, Пациент 1. Ваша запись на завтра на МРТ головного мозга в 15:30. Телефон для связи: Телефон 1. Подтверждаете запись?»
С точки зрения внешнего провайдера, он получил безобидный пример, где «Пациент 1» — абстрактное лицо без идентификации.
Шаг 4. Возврат ответа и обратная подстановка
Ответ модели возвращается с теми же маркерами. На нашей стороне мы обращаемся к локальной таблице соответствия и подставляем реальные данные обратно. Клиенту уходит полноценный ответ:
«Иван Петрович подтвердил запись на МРТ головного мозга на завтра в 15:30».
Данные пациента физически не покидали контур российской инфраструктуры.
Голосовые данные: отдельное требование
Для голосовых агентов схема сложнее только на этапе распознавания речи. Аудио с голосом клиента должно расшифровываться в текст либо локально на сервере в РФ, либо в облачном сервисе, размещенном в России. Отправлять аудио напрямую в зарубежные сервисы распознавания недопустимо: это уже трансграничная передача персональных данных. Практические варианты для российского бизнеса:
Yandex SpeechKit — российский облачный сервис распознавания и синтеза речи, серверы в РФ;
Sber SmartSpeech — аналогичный сервис от Сбера, серверы в РФ;
локальный Whisper — open-source модель распознавания, развернутая на своих серверах в РФ;
Vosk — российский open-source вариант, локальное развертывание.
После того как аудио превратилось в текст на территории РФ, дальше работает та же схема замены на маркеры. Синтез речи для ответа клиенту также делается через российские сервисы.
Почему это соответствует 152-ФЗ
Такая схема закрывает несколько требований закона одновременно:
Локализация персональных данных (статья 18.1). Первичная база с реальными данными хранится только на нашем сервере в РФ. За границу уходит уже обезличенный вариант, к субъекту не относящийся.
Метод обезличивания (Приказ Роскомнадзора № 996 от 05.09.2013). Мы применяем метод введения идентификаторов — один из четырех стандартных методов, утвержденных регулятором.
Договор поручения обработки (статья 6). С каждым клиентом-оператором заключается договор, где прописано, какие данные обрабатываются, с какой целью и какие меры защиты применяются.
Защита специальных категорий (статья 10). Данные о здоровье обрабатываются в защищенном контуре и до отправки во внешние сервисы заменяются на маркеры.
Внешние языковые модели в этой схеме не являются операторами персональных данных россиян: они не получают идентифицирующую информацию, а видят только обезличенный технический контекст.
Итог
Работа с сильными внешними LLM и соблюдение 152-ФЗ не противоречат друг другу, если выстроить процесс правильно. Ключевые пункты нашей схемы:
первичная база с персональными данными хранится на выделенном сервере в РФ, отдельно под каждого клиента;
до отправки во внешнюю модель все идентифицирующие поля заменяются на маркеры;
таблица соответствия «маркер → значение» хранится локально и не покидает контур;
ответ модели возвращается с маркерами, реальные данные подставляются обратно на нашей стороне;
голос обрабатывается в РФ, зарубежные сервисы распознавания напрямую не используются;
с каждым клиентом-оператором заключается договор поручения обработки.
Такая архитектура позволяет использовать современные нейросети для клиентских задач, не нарушая закон о персональных данных и не создавая юридических или репутационных рисков для бизнеса.
Частые вопросы
Можно ли использовать нейросети (ИИ) с персональными данными по 152-ФЗ?
Напрямую отправлять персональные данные в зарубежную модель нельзя. Но можно обезличить их: заменить на маркеры до отправки и восстановить на своей стороне. Тогда во внешнюю модель уходят только маркеры, и она не становится оператором персональных данных.
Что такое обезличивание персональных данных?
Это обработка, после которой по данным нельзя определить конкретного человека без дополнительной информации. Один из утвержденных методов — введение идентификаторов (замена значений на маркеры), закреплен Приказом Роскомнадзора № 996.
Как обезличить данные перед отправкой в LLM?
Автоматически найти персональные данные в тексте (имена, телефоны, адреса, диагнозы), заменить их на маркеры вида «Пациент 1», отправить в модель обезличенный текст, а в ответе подставить реальные значения обратно по локальной таблице соответствия, которая хранится в РФ.
Где должны обрабатываться голосовые данные клиентов?
Распознавание и синтез речи должны выполняться в РФ — через Yandex SpeechKit, Sber SmartSpeech или локальные модели (Whisper, Vosk). Отправлять аудио с голосом в зарубежные сервисы распознавания напрямую недопустимо.
Кто отвечает за персональные данные в этой схеме?
Оператор (наш клиент) и мы как обработчик по договору поручения. Внешняя языковая модель оператором персональных данных не является — она видит только маркеры и не получает идентифицирующую информацию.