mksim.pro
К списку статей
ИИ 10 мин чтения

Как запретить ИИ учиться на ваших промптах и переписке

Разбираю по-честному, для человека и для компании: где чат-боты по умолчанию учатся на вашей переписке, как это выключить и почему opt-out не стирает то, что модель уже выучила.

Это самый частый практический вопрос, который мне задают про ИИ: «А правда, что всё, что я пишу в чат-бот, потом уходит в обучение модели?» Ответ короткий и неприятный: в бесплатных потребительских версиях многих ассистентов - да, по умолчанию ваши диалоги используются для улучшения моделей, пока вы это не выключите руками. В корпоративных тарифах и через API - как правило, нет. Вся практика умещается в это различие.

Дальше начинаются нюансы, и именно в них люди путаются. Одни думают, что достаточно поставить галочку и прошлое сотрется. Другие уверены, что раз они платят подписку, то защищены автоматически. Третьи выкатывают сотрудникам приказ «не пользоваться ИИ» и считают вопрос закрытым. Все три позиции неверны.

Я разберу это по слоям: что происходит по умолчанию, как выключить обучение в конкретных сервисах, чего opt-out принципиально не делает, и как выглядит грамотный контур для компании. Оговорюсь сразу: интерфейсы и формулировки настроек меняются часто, поэтому в конце каждого шага я советую проверять актуальное состояние у себя в аккаунте, а не полагаться на скриншот из статьи.

Главный рычаг - это ваш тариф

Поведение по умолчанию резко различается по уровням обслуживания, и это ключ ко всему остальному.

  • Бесплатные и потребительские чат-тарифы. Здесь провайдер, как правило, оставляет за собой право использовать ваши разговоры для улучшения моделей. Это записано в пользовательском соглашении, и по умолчанию оно включено. Вы можете отказаться, но отказ - это осознанное действие с вашей стороны.
  • Бизнес-, командные и корпоративные тарифы. Business, Team, Enterprise. Здесь по договору контент, как правило, исключен из обучения по умолчанию. Провайдер обрабатывает данные как подрядчик, а не как владелец, который волен учить на них свои модели.
  • API. Программный доступ обычно тоже исключен из обучения по умолчанию и работает под коммерческими условиями. Если вы встраиваете модель в свой продукт, ваши входные данные, как правило, не идут в общий котёл.

Отсюда простое правило: если работа чувствительная, вы переносите её на бизнес-уровень или в API, а не пытаетесь героически защитить бесплатный чат галочками. Галочки полезны, но тариф - это тот слой, который владеет вопросом.

Почему так устроено, тоже полезно понимать. Обучение на пользовательских данных - это способ провайдера удешевить и улучшить бесплатный продукт: вы платите не деньгами, а данными. На платных бизнес-контурах логика обратная: клиент платит деньгами и покупает в том числе гарантию, что его содержимое не пойдёт в общую модель, потому что иначе такой контур просто нельзя было бы продать корпоративному юристу. Поэтому дефолты и различаются: бесплатный тариф оптимизирован под улучшение модели, платный - под приватность клиента. Держа это в голове, вы перестаёте удивляться, почему одна и та же кнопка «отправить» в двух аккаунтах ведёт себя по-разному.

Как выключить обучение в конкретных сервисах

Ниже - обобщенные пути. Названия пунктов меняются, поэтому я даю смысл настройки, а не точный текст кнопки. Открывайте настройки приватности своего аккаунта и ищите именно эту логику.

ChatGPT (OpenAI)

  • В разделе управления данными (Data Controls) есть переключатель вида «Улучшать модель для всех». Выключите его - и новые диалоги перестанут использоваться для обучения.
  • Для разовых чувствительных сессий есть «Временный чат» (Temporary Chat): такой разговор не попадает в историю и не идет на обучение.
  • ChatGPT Team и Enterprise, а также доступ через API по условиям не используются для обучения. Если у вас в компании чувствительные задачи, это правильный уровень.

Claude (Anthropic)

  • В потребительских настройках есть контроль того, используются ли ваши чаты для улучшения моделей. Проверьте состояние этого переключателя в своём аккаунте.
  • Claude for Work (командные и корпоративные планы) и доступ через API работают под коммерческими условиями, которые по умолчанию исключают обучение на вашем контенте.

Google Gemini

  • Ключевая настройка называется «Активность приложений Gemini» (Gemini Apps Activity). Она управляет хранением истории и тем, могут ли люди просматривать ваши разговоры для улучшения сервиса.
  • Если её выключить, использование ваших данных для улучшения ограничивается. Обратите внимание: у хранения и человеческого ревью своя логика, читайте пояснения прямо в настройке.

Генераторы изображений (Midjourney, Stability и подобные)

  • Здесь опции уже. У части сервисов есть платный «скрытый режим» (stealth) или отдельный opt-out, но покрытие уже, чем в текстовых ассистентах.
  • Исходите из того, что публичные генерации могут быть видны другим и использованы. Если картинка содержит что-то чувствительное - фирменный стиль до релиза, лицо конкретного человека, внутренний макет - относитесь к публичному тарифу как к публикации.

Чего opt-out НЕ делает

Здесь ломается большинство ожиданий, поэтому скажу прямо: отключение обучения не работает задним числом.

Галочка «не учиться на моих данных» останавливает будущее обучение на новых данных. Она не удаляет то, что модель уже выучила. Веса, которые уже обучены на ранее собранных диалогах, от вашего сегодняшнего отказа не меняются. Модель - это не база данных, из которой можно удалить строку; это результат обучения, в котором ваши прошлые данные уже растворены в миллиардах параметров.

Из этого следуют два практических вывода:

  • Выключайте обучение как можно раньше, а не после того, как уже слили туда полгода рабочей переписки. Ценность отказа - в будущем, а не в прошлом.
  • Если вопрос именно в том, чтобы убрать уже попавшее в модель, это отдельная и куда более тяжелая тема. Я разбираю её в тексте про то, можно ли удалить свои данные из уже обученной модели - если коротко, opt-out и удаление это разные вещи, и второе почти никогда не бывает мгновенным.

Смежный вопрос - а может ли модель потом «выдать» то, что запомнила из вашего текста. Это реальный, хотя и нечастый эффект, и он тоже про прошлое, а не про будущее. Разбор - в тексте про то, может ли ИИ утечь персональные данные через запоминание.

Для компании главный риск - это shadow AI

С отдельным человеком всё относительно просто: выключил галочки, для чувствительного - временный чат или платный тариф. В компании картина другая, и настоящая проблема называется shadow AI.

Механика такая: сотрудники, чтобы работать быстрее, вставляют в бесплатные потребительские чат-боты то, что под рукой. Данные клиентов. Куски кода. Тексты договоров. Выгрузки из CRM. Делают они это без злого умысла - им нужно сделать задачу, а бесплатный чат под рукой и удобен. Но с точки зрения контура это утечка: чувствительное содержимое ушло во внешний сервис, у которого по умолчанию включено обучение.

Коварство здесь в том, что утечка невидима. Нет всплывающего окна, нет скачанного файла, нет сработавшего DLP на почте - есть просто человек, который скопировал текст в браузер и получил ответ. Классические средства контроля периметра эту дверь не видят, потому что для них это обычный HTTPS-трафик к легитимному сайту. Именно поэтому shadow AI обходит те же контроли, что раньше ловили пересылку документов на личную почту: канал другой, а данные те же. Я подробнее разбирал эту логику в тексте про то, как shadow AI становится новым периметром контроля доступа.

Приказ «не пользуйтесь ИИ» эту проблему не решает, а загоняет её в тень. Люди всё равно пользуются, просто перестают об этом говорить, и вы теряете даже видимость происходящего. Работает другое сочетание:

  • Политика. Понятное правило, что можно отдавать модели, а что нельзя, и на каком инструменте.
  • Санкционированный инструмент бизнес-уровня. Один одобренный ассистент на Business или Enterprise тарифе, с подписанным соглашением об обработке данных (DPA) и выключенным обучением и хранением.

То есть вы не запрещаете ИИ, вы даёте людям легальную удобную дверь, чтобы они перестали лезть в бесплатную.

Связь с 152-ФЗ

Отдельно для российского контекста. Когда сотрудник отправляет персональные данные клиента во внешнюю модель, это не «просто чат» - это обработка персональных данных и, как правило, их передача третьему лицу, оператору этого сервиса.

Значит, включаются обычные требования: у обработки должна быть законная цель, а согласие клиента, если вы на него опираетесь, должно эту цель покрывать. «Мы отправили ваши данные в зарубежный чат-бот, чтобы он написал нам письмо» - это, скорее всего, за пределами того, на что человек соглашался. Плюс важны условия самого вендора: на каком тарифе вы работаете, исключено ли обучение, где физически обрабатываются данные. Бесплатный потребительский тариф с включенным обучением - это худший из возможных вариантов для персональных данных клиентов, и в контексте оборотных штрафов это тот риск, который стоит закрыть в первую очередь. Если хочется системно посмотреть на весь ИИ-контур глазами 152-ФЗ - это как раз то, чем я занимаюсь в аудите ИИ на защиту персональных данных.

Как бы я действовал на месте компании

Практический порядок, который я обычно и предлагаю:

  1. Инвентаризация. Понять, куда сейчас утекают промпты. Какие инструменты реально используют сотрудники, что они туда вставляют, на каких тарифах. Часто это первое же упражнение открывает глаза.
  2. Перенос чувствительного. Всё, что касается клиентов, кода, договоров, финансов - на бизнес- или корпоративный тариф либо на self-hosted решение. Если данные вообще не должны покидать периметр, смотрите в сторону локального ИИ; я писал об этом в тексте про локальный ИИ, чтобы данные не покидали контур.
  3. Договор и настройки. Подписать DPA, выключить обучение и, где можно, сократить или отключить хранение истории на стороне вендора.
  4. Минимизация промпта. Отдавать модели ровно столько, сколько нужно для задачи. Обезличивать, где можно. Не вставлять весь документ, если хватает выдержки.
  5. Один одобренный инструмент. Дать людям удобный санкционированный ассистент, чтобы у них не было причины тянуться к бесплатному. Удобство здесь - это часть безопасности.

Честные оговорки

  • Настройки меняются. Провайдеры регулярно переименовывают пункты, меняют дефолты и перекладывают переключатели. Всё, что я описал - это логика, а не вечная инструкция. Перед тем как на что-то положиться, проверьте актуальное состояние в своём аккаунте и в текущей версии условий.
  • «Исключено из обучения» не равно «не хранится». Даже когда контент не идёт в обучение, он может какое-то время храниться для абьюз-мониторинга или отладки, и его могут просматривать люди в узких сценариях. Это разные гарантии, читайте условия внимательно.
  • Opt-out - это про будущее. Повторю, потому что на этом спотыкаются: отказ не откатывает уже обученные веса.
  • Бесплатный тариф - публичная зона. Самая надёжная политика для по-настоящему секретного - вообще не отдавать это внешней модели на потребительском тарифе, а не полагаться на то, что галочка всех спасёт.
  • Я не юрист. Часть про 152-ФЗ - это инженерная рамка того, как я вижу риск. Конкретную квалификацию обработки и формулировки согласий проверяйте с юристом.

Если коротко

  • В бесплатных потребительских чат-тарифах ваши диалоги по умолчанию идут на улучшение моделей, пока вы это не выключите.
  • Бизнес-, командные, корпоративные тарифы и API, как правило, исключают обучение на вашем контенте по договору. Это главный рычаг.
  • Opt-out останавливает будущее обучение, но не стирает то, что модель уже выучила.
  • Для компании ключевой риск - shadow AI: сотрудники в бесплатных чатах. Лечится политикой плюс одним санкционированным бизнес-инструментом с DPA, а не приказом «не пользоваться ИИ».
  • В российском контексте отправка персональных данных клиента во внешнюю модель - это обработка и передача, где важны цель, согласие и условия вендора.

Если вы хотите не просто выключить пару галочек, а понять, куда в вашей компании реально утекают промпты и как привести этот контур в соответствие с 152-ФЗ, я помогаю это разобрать в рамках аудита ИИ на защиту персональных данных - начинаем с инвентаризации того, что уже уходит наружу, и дальше по слоям.

К списку статей
Контакт

Если эта статья отозвалась - напишите. Я отвечаю лично.

Telegram TenChat MAX