FL Гид
statya2-min.webp
Дата
Просмотрено
eye 1 920
Новости компании

Большие языковые модели и эффект случайного попутчика

Большие языковые модели (LLM) — ChatGPT, Gemini, Copilot — всё чаще получают от сотрудников конфиденциальные корпоративные данные: договоры, исходный код, технические спецификации, информацию о клиентах, которая не должна покидать периметр компании.

Это параллель к «эффекту случайного попутчика», описанному психологом Зиком Рубиным: люди делятся личным со встретившимися незнакомцами, с которыми больше никогда не увидятся. Для корпоративной ИБ LLM — это поезд. Статья описывает четыре ключевых проблемы конфиденциальности, которые решает Guardora.

Корпоративная информационная безопасность все больше обеспокоена растущим числом случаев, когда сотрудники делятся конфиденциальными данными с ChatGPT, Gemini, Copilot и другими менее известными большими языковыми моделями.

Юристы составляют краткие справки по договорам, содержащим данные о контрагентах, технические спецификации, цены и особые условия. Программисты редактируют код, важный для критических архитектур. Переводчики работают с текстами, содержащими конфиденциальную информацию.

С другой стороны, компании пытаются интегрировать ИИ-помощников и заменить традиционные модели машинного обучения на LLM.

Вот несколько примеров использования, с которыми мы столкнулись в Guardora:

  • Прослушивание записей отдела продаж для оценки и анализа их взаимодействия с клиентами.
  • Понимание тональности взаимодействия с клиентами в режиме реального времени. Например, если клиент становится более раздражительным, система может переключить его на специалиста более высокого ранга, который сможет решить его проблемы и разрядить негативные настроения.
  • Кластеризация пользователей на основе интересов и других критериев.
  • Создание систем поиска и анализа документов с такими задачами, как резюмирование, исключение ключевых слов и защита персональных данных.
  • Генерация текста, изображений, музыки и других медиафайлов с использованием источников с уникальным собственным контентом.
  • Локализация видео с языка оригинала на другие языки.
  • Разработка кластеров новых продуктов - помощников, которые поддерживают команды разработчиков, повышая производительность и сокращая время выхода на рынок. Они минимизируют ошибки и справляются с задачами, которые многим часто не нравятся (например, тестирование, документирование, обучение младших сотрудников). Эти инструменты в основном направлены на генерацию, проверку и отладку кода в различных тестах.

Однако главная проблема на этом обширном рынке использование LLM при обеспечении доступа к данным только для их владельца. Как защитить данные от третьих лиц, поставщиков облачных услуг или злоумышленников на всех этапах их передачи, хранения, обучения моделей, проверки качества и получения результатов?

Именно эту проблему призвана решить компания Guardora. Наши решения уже обеспечивают безопасность данных для некоторых сценариев использования на всем их пути, включая обучение ML-модели, проверку качества, вывод, а иногда даже защиту самой модели как интеллектуальной собственности.

В Guardora мы уделяем особое внимание обеспечению конфиденциальности запросов к ML-моделям и хотим сделать то же самое с LLM и генеративными моделями.

Вот список текущих проблем, которые нам необходимо решить до запуска наших первых прототипов:

  1. Обеспечение конфиденциальности обучающих наборов данных во время первоначального обучения LLM и генеративных моделей.
  2. Предотвращение несанкционированного использования LLM и генеративных моделей, обученных с нуля, третьими лицами.
  3. Защита конфиденциальности данных, используемых для тонкой настройки предварительно обученных LLM и генеративных моделей.
  4. Обеспечение конфиденциальности запросов, отправляемых к LLM и генеративным моделям.

Если эта тема интересует вас как пользователя или разработчика, присоединяйтесь к нашему сообществу Discord и участвуйте в обсуждении этих актуальных вопросов.

Часто задаваемые вопросы

Что такое «эффект случайного попутчика» в контексте LLM?

«Эффект случайного попутчика» — термин, введённый социальным психологом Зиком Рубиным для описания склонности людей делиться личной информацией с незнакомцами, которых они вряд ли встретят снова (например, попутчики в длинной поездке). Применительно к большим языковым моделям: сотрудники часто делятся конфиденциальными корпоративными данными (договоры, исходный код, информация о клиентах) с ChatGPT, Gemini или Copilot так, как никогда не поделились бы с человеком-незнакомцем. LLM ощущается как одноразовый диалог — даже когда на практике данные покидают периметр компании и могут использоваться для обучения модели, логироваться для compliance или обрабатываться сторонними провайдерами.

Какими конфиденциальными данными сотрудники обычно делятся с ChatGPT, Gemini и Copilot?

По наблюдаемым сценариям: юристы загружают резюме договоров с данными контрагентов, ценами и особыми условиями. Программисты копируют исходный код архитектурно-критичных систем для отладки или рекомендаций по рефакторингу. Переводчики обрабатывают тексты с коммерческими тайнами, M&A-деталями или персональной информацией. Команды продаж и клиентского сопровождения транскрибируют и анализируют записи звонков с клиентами. Продуктовые команды загружают проприетарные документы для резюмирования и анализа. Аналитики — финансовые данные для интерпретации. Ни одна из этих операций не должна покидать периметр организации по стандартам корпоративной ИБ.

Могут ли мои корпоративные данные стать достоянием третьих лиц при использовании ChatGPT в работе?

Зависит от того, какое развёртывание LLM и какой тарифный план. Бесплатный ChatGPT исторически логировал диалоги и использовал их для улучшения модели — хотя OpenAI теперь предлагает opt-out и Enterprise-тарифы без обучения на данных клиентов. Microsoft Copilot в интеграции через Microsoft 365 Enterprise имеет гарантии защиты данных. Однако: провайдер модели видит запросы в открытом виде на своей инфраструктуре. Действительно конфиденциальные нагрузки требуют либо on-premise развёртывания LLM, либо криптографической защиты самого инференс-запроса — это и есть направление конфиденциального ML, которое исследует Guardora.

Каковы основные проблемы конфиденциальности при коммерческом внедрении LLM?

Guardora выделяет четыре ключевые задачи.

  1. Конфиденциальность обучающих данных — защита проприетарных датасетов при первоначальном обучении LLM или генеративной модели.
  2. Несанкционированное использование модели — предотвращение того, чтобы третьи стороны запускали инференс на модели, обученной с нуля на чужих данных.
  3. Конфиденциальность данных для дообучения — защита чувствительных данных, используемых для тонкой настройки предобученной foundation-модели (например, доменно-специфичных корпоративных знаний).
  4. Конфиденциальность запросов — защита промптов и ответов так, чтобы провайдер модели, облако или перехватчики не могли их прочитать.

Как компаниям использовать LLM без утечки конфиденциальных данных?

Три основных подхода.

  • On-premise развёртывание LLM — запуск открытых моделей (Llama, Mistral, Qwen-варианты) внутри собственной инфраструктуры компании. Самый дорогой, но самый контролируемый.
  • Enterprise-тарифы с контрактными гарантиями — ChatGPT Enterprise, Copilot for M365, Gemini Enterprise — провайдер модели обязуется не обучаться на данных клиента, но всё ещё видит промпты в открытом виде.
  • Конфиденциальный инференс LLM — криптографические техники (гомоморфное шифрование, безопасные многосторонние вычисления, доверенные среды исполнения) так, чтобы провайдер не видел промпты в открытом виде.

Третий путь ещё созревает — здесь и работает Guardora.

Что такое конфиденциальный инференс LLM?

Конфиденциальный инференс LLM — это криптографическая защита pipeline'а «промпт ↔ ответ» так, что сторона, запускающая LLM (провайдер модели, облако или любая третья сторона), не может увидеть реальный промпт пользователя и реальный ответ модели в открытом виде. Несколько техник в активной разработке:

  • гомоморфное шифрование входа/выхода (очень медленно, но математически надёжно),
  • доверенные среды исполнения (TEE) — Intel TDX, AMD SEV-SNP, NVIDIA Confidential Compute (аппаратная изоляция, быстрее, но с доверием к железу),
  • безопасные многосторонние вычисления (разделение вычислений между сторонами).

Промышленный конфиденциальный LLM-инференс масштаба GPT-4 в 2026 году пока в зачаточном состоянии.

Кто такой Зик Рубин и что такое оригинальная теория «случайного попутчика»?

Зик Рубин (родился в 1944) — американский социальный психолог, наиболее известный исследованиями привязанности и самораскрытия. Он разработал «шкалу Рубина», измеряющую симпатию против любви, и его работы по самораскрытию описали так называемый эффект случайного попутчика: в условиях анонимности и однократного взаимодействия люди часто раскрывают больше личной информации, чем тем, с кем рассчитывают встретиться снова. Статья Guardora применяет это наблюдение из человеческого поведения к эре LLM — модель создаёт иллюзию однократного анонимного диалога, провоцируя чрезмерную откровенность.

Что Guardora делает в области конфиденциальности LLM?

Основные продуктивные продукты Guardora сегодня — Guardora VFL (вертикальное федеративное обучение для табличного ML — банки, страховые, здравоохранение) и Guardora FFT (федеративный файнтюнинг, включая для foundation-моделей). Конфиденциальность LLM — активная исследовательская область: Guardora публично обозначила четыре задачи к решению до запуска коммерческих LLM-продуктов: конфиденциальность обучения, защита от несанкционированного использования, защита данных дообучения и конфиденциальность запросов. Для активного обсуждения LLM-роадмапа присоединяйтесь к Discord-сообществу Guardora по ссылке в статье. Готовые к продакшену конфиденциальные LLM-продукты сегодня находятся в дорожной карте Guardora, а не в коммерческом доступе.

logo

Последние статьи

все статьи
confidential_computing_won.png

Конфиденциальные вычисления выиграли раунд. Но рынок, возможно, переоценил цену доверия…

На рынке технологий конфиденциальности пока побеждает не самый криптографически строгий, а самый практичный подход.

eye 336
logo
ppml_2026.png

Аппаратная приватность опережает регулирование: что это означает для внедрения PPML в 2026 году

Изначальная идея конфиденциального МО — регулирование стимулирует внедрение технологий — только что провалилась.

eye 270
logo
nvidia_flower_guardora_fl.png

Инструменты федеративного файнтюнинга в 2026 году: Guardora FFT vs. Flower vs. NVIDIA FLARE

Три инструмента федеративного файнтюнинга предлагают альтернативные пути. Выберите подходящий для решения вашей задачи.

eye 313
logo
все статьи
Подпишитесь
на наши новости