Это параллель к «эффекту случайного попутчика», описанному психологом Зиком Рубиным: люди делятся личным со встретившимися незнакомцами, с которыми больше никогда не увидятся. Для корпоративной ИБ LLM — это поезд. Статья описывает четыре ключевых проблемы конфиденциальности, которые решает Guardora.
Корпоративная информационная безопасность все больше обеспокоена растущим числом случаев, когда сотрудники делятся конфиденциальными данными с ChatGPT, Gemini, Copilot и другими менее известными большими языковыми моделями.
Юристы составляют краткие справки по договорам, содержащим данные о контрагентах, технические спецификации, цены и особые условия. Программисты редактируют код, важный для критических архитектур. Переводчики работают с текстами, содержащими конфиденциальную информацию.
С другой стороны, компании пытаются интегрировать ИИ-помощников и заменить традиционные модели машинного обучения на LLM.
Вот несколько примеров использования, с которыми мы столкнулись в Guardora:
- Прослушивание записей отдела продаж для оценки и анализа их взаимодействия с клиентами.
- Понимание тональности взаимодействия с клиентами в режиме реального времени. Например, если клиент становится более раздражительным, система может переключить его на специалиста более высокого ранга, который сможет решить его проблемы и разрядить негативные настроения.
- Кластеризация пользователей на основе интересов и других критериев.
- Создание систем поиска и анализа документов с такими задачами, как резюмирование, исключение ключевых слов и защита персональных данных.
- Генерация текста, изображений, музыки и других медиафайлов с использованием источников с уникальным собственным контентом.
- Локализация видео с языка оригинала на другие языки.
- Разработка кластеров новых продуктов - помощников, которые поддерживают команды разработчиков, повышая производительность и сокращая время выхода на рынок. Они минимизируют ошибки и справляются с задачами, которые многим часто не нравятся (например, тестирование, документирование, обучение младших сотрудников). Эти инструменты в основном направлены на генерацию, проверку и отладку кода в различных тестах.
Однако главная проблема на этом обширном рынке ― использование LLM при обеспечении доступа к данным только для их владельца. Как защитить данные от третьих лиц, поставщиков облачных услуг или злоумышленников на всех этапах их передачи, хранения, обучения моделей, проверки качества и получения результатов?
Именно эту проблему призвана решить компания Guardora. Наши решения уже обеспечивают безопасность данных для некоторых сценариев использования на всем их пути, включая обучение ML-модели, проверку качества, вывод, а иногда даже защиту самой модели как интеллектуальной собственности.
В Guardora мы уделяем особое внимание обеспечению конфиденциальности запросов к ML-моделям и хотим сделать то же самое с LLM и генеративными моделями.
Вот список текущих проблем, которые нам необходимо решить до запуска наших первых прототипов:
- Обеспечение конфиденциальности обучающих наборов данных во время первоначального обучения LLM и генеративных моделей.
- Предотвращение несанкционированного использования LLM и генеративных моделей, обученных с нуля, третьими лицами.
- Защита конфиденциальности данных, используемых для тонкой настройки предварительно обученных LLM и генеративных моделей.
- Обеспечение конфиденциальности запросов, отправляемых к LLM и генеративным моделям.
Если эта тема интересует вас как пользователя или разработчика, присоединяйтесь к нашему сообществу Discord и участвуйте в обсуждении этих актуальных вопросов.
Часто задаваемые вопросы
Что такое «эффект случайного попутчика» в контексте LLM?
«Эффект случайного попутчика» — термин, введённый социальным психологом Зиком Рубиным для описания склонности людей делиться личной информацией с незнакомцами, которых они вряд ли встретят снова (например, попутчики в длинной поездке). Применительно к большим языковым моделям: сотрудники часто делятся конфиденциальными корпоративными данными (договоры, исходный код, информация о клиентах) с ChatGPT, Gemini или Copilot так, как никогда не поделились бы с человеком-незнакомцем. LLM ощущается как одноразовый диалог — даже когда на практике данные покидают периметр компании и могут использоваться для обучения модели, логироваться для compliance или обрабатываться сторонними провайдерами.
Какими конфиденциальными данными сотрудники обычно делятся с ChatGPT, Gemini и Copilot?
По наблюдаемым сценариям: юристы загружают резюме договоров с данными контрагентов, ценами и особыми условиями. Программисты копируют исходный код архитектурно-критичных систем для отладки или рекомендаций по рефакторингу. Переводчики обрабатывают тексты с коммерческими тайнами, M&A-деталями или персональной информацией. Команды продаж и клиентского сопровождения транскрибируют и анализируют записи звонков с клиентами. Продуктовые команды загружают проприетарные документы для резюмирования и анализа. Аналитики — финансовые данные для интерпретации. Ни одна из этих операций не должна покидать периметр организации по стандартам корпоративной ИБ.
Могут ли мои корпоративные данные стать достоянием третьих лиц при использовании ChatGPT в работе?
Зависит от того, какое развёртывание LLM и какой тарифный план. Бесплатный ChatGPT исторически логировал диалоги и использовал их для улучшения модели — хотя OpenAI теперь предлагает opt-out и Enterprise-тарифы без обучения на данных клиентов. Microsoft Copilot в интеграции через Microsoft 365 Enterprise имеет гарантии защиты данных. Однако: провайдер модели видит запросы в открытом виде на своей инфраструктуре. Действительно конфиденциальные нагрузки требуют либо on-premise развёртывания LLM, либо криптографической защиты самого инференс-запроса — это и есть направление конфиденциального ML, которое исследует Guardora.
Каковы основные проблемы конфиденциальности при коммерческом внедрении LLM?
Guardora выделяет четыре ключевые задачи.
- Конфиденциальность обучающих данных — защита проприетарных датасетов при первоначальном обучении LLM или генеративной модели.
- Несанкционированное использование модели — предотвращение того, чтобы третьи стороны запускали инференс на модели, обученной с нуля на чужих данных.
- Конфиденциальность данных для дообучения — защита чувствительных данных, используемых для тонкой настройки предобученной foundation-модели (например, доменно-специфичных корпоративных знаний).
- Конфиденциальность запросов — защита промптов и ответов так, чтобы провайдер модели, облако или перехватчики не могли их прочитать.
Как компаниям использовать LLM без утечки конфиденциальных данных?
Три основных подхода.
- On-premise развёртывание LLM — запуск открытых моделей (Llama, Mistral, Qwen-варианты) внутри собственной инфраструктуры компании. Самый дорогой, но самый контролируемый.
- Enterprise-тарифы с контрактными гарантиями — ChatGPT Enterprise, Copilot for M365, Gemini Enterprise — провайдер модели обязуется не обучаться на данных клиента, но всё ещё видит промпты в открытом виде.
- Конфиденциальный инференс LLM — криптографические техники (гомоморфное шифрование, безопасные многосторонние вычисления, доверенные среды исполнения) так, чтобы провайдер не видел промпты в открытом виде.
Третий путь ещё созревает — здесь и работает Guardora.
Что такое конфиденциальный инференс LLM?
Конфиденциальный инференс LLM — это криптографическая защита pipeline'а «промпт ↔ ответ» так, что сторона, запускающая LLM (провайдер модели, облако или любая третья сторона), не может увидеть реальный промпт пользователя и реальный ответ модели в открытом виде. Несколько техник в активной разработке:
- гомоморфное шифрование входа/выхода (очень медленно, но математически надёжно),
- доверенные среды исполнения (TEE) — Intel TDX, AMD SEV-SNP, NVIDIA Confidential Compute (аппаратная изоляция, быстрее, но с доверием к железу),
- безопасные многосторонние вычисления (разделение вычислений между сторонами).
Промышленный конфиденциальный LLM-инференс масштаба GPT-4 в 2026 году пока в зачаточном состоянии.
Кто такой Зик Рубин и что такое оригинальная теория «случайного попутчика»?
Зик Рубин (родился в 1944) — американский социальный психолог, наиболее известный исследованиями привязанности и самораскрытия. Он разработал «шкалу Рубина», измеряющую симпатию против любви, и его работы по самораскрытию описали так называемый эффект случайного попутчика: в условиях анонимности и однократного взаимодействия люди часто раскрывают больше личной информации, чем тем, с кем рассчитывают встретиться снова. Статья Guardora применяет это наблюдение из человеческого поведения к эре LLM — модель создаёт иллюзию однократного анонимного диалога, провоцируя чрезмерную откровенность.
Что Guardora делает в области конфиденциальности LLM?
Основные продуктивные продукты Guardora сегодня — Guardora VFL (вертикальное федеративное обучение для табличного ML — банки, страховые, здравоохранение) и Guardora FFT (федеративный файнтюнинг, включая для foundation-моделей). Конфиденциальность LLM — активная исследовательская область: Guardora публично обозначила четыре задачи к решению до запуска коммерческих LLM-продуктов: конфиденциальность обучения, защита от несанкционированного использования, защита данных дообучения и конфиденциальность запросов. Для активного обсуждения LLM-роадмапа присоединяйтесь к Discord-сообществу Guardora по ссылке в статье. Готовые к продакшену конфиденциальные LLM-продукты сегодня находятся в дорожной карте Guardora, а не в коммерческом доступе.