отвечаю в первом абзаце: отправлять данные компании в нейросети можно, если понимать, какие именно данные, через какой канал и с какими настройками. обезличенную операционку — спокойно. коммерческую тайну и персональные данные клиентов — только через api с отключённым обучением или через локальные модели, и то после обезличивания. пароли, ключи и полные базы клиентов — никуда и никогда, ни при каких настройках. а самый реальный риск утечки в 2026 году — не «openai украдёт вашу стратегию», а ваш же сотрудник, который с личного аккаунта вставляет в chatgpt договор с клиентом, потому что ему никто не объяснил, что так нельзя. дальше — матрица по типам данных, настройки по шагам и когда действительно нужна локальная модель.

как данные вообще утекают — три сценария

чтобы не бояться всего подряд, полезно понимать механику. реальных сценария три:

  • данные попадают в обучение. бесплатные и личные версии chatgpt по умолчанию могут использовать переписку для обучения моделей. это значит: теоретически фрагмент вашего текста однажды может всплыть в чужом ответе. вероятность конкретной утечки мизерная, но для коммерческой тайны «мизерная» — не аргумент.
  • данные лежат на чужих серверах. даже без обучения переписка хранится у провайдера. взломают провайдера, придёт запрос от регулятора чужой юрисдикции, сотрудник провайдера ошибётся — сценарии маловероятные, но ненулевые. вопрос не «утечёт ли», а «что именно там лежит, если утечёт».
  • данные утекают по-старинке. сотрудник скинул выгрузку клиентов в личный gpt, уволился и унёс аккаунт с историей. никакая модель тут не виновата — это классическая дыра в процессах, просто с новым инструментом.

третий сценарий в практике встречается на порядок чаще первых двух. запомним это — вернёмся в конце.

матрица: что можно, что с оговорками, что нельзя

данныеличный chatgpt / бесплатные ботыapi / корпоративный тариф с отключённым обучениемлокальная модель
публичная информация: тексты с сайта, вакансии, постыможноможноможно
внутренняя операционка без имён: регламенты, шаблоны, черновикиможно, но лучше не надоможноможно
обезличенные данные клиентов: «клиент n спросил про доставку»нельзяможноможно
персональные данные: имена, телефоны, почты клиентовнельзяс оговорками — только при реальной необходимости и с обезличиванием всего лишнегоможно
коммерческая тайна: цены закупки, маржа, стратегия, m&aнельзяс оговорками — оцените цену утечкипредпочтительно
пароли, api-ключи, доступы, полные выгрузки базы клиентовникогданикогдатоже нет — им в промптах вообще нечего делать

главная строка этой таблицы — последняя. пароли и ключи не «рискованно отправлять» — их отправлять бессмысленно: ни одна задача для нейросети не требует настоящего пароля. если ключ оказался в промпте, это ошибка процесса, а не вопрос доверия к провайдеру.

настройки не-обучения: пять минут на весь эффект

самое дешёвое улучшение безопасности из возможных:

  1. chatgpt: настройки → data controls → выключить «improve the model for everyone». в командном и enterprise-тарифах обучение на ваших данных выключено по умолчанию — это одна из главных причин платить за team, а не раздавать личные аккаунты.
  2. claude: обучение на пользовательских данных по умолчанию не ведётся на корпоративных тарифах; в личных настройках проверьте раздел privacy. api-трафик для обучения не используется.
  3. api вместо чата. всё, что автоматизировано (агенты, интеграции), ходит через api — а api-данные крупные провайдеры не используют для обучения. типовой агент в этом смысле безопаснее, чем сотрудник с чатом.
  4. зафиксируйте письменно, какой тариф и какие настройки у вас приняты. не для бюрократии — для нового сотрудника, который завтра принесёт личный аккаунт.

важная оговорка: «не обучаемся на ваших данных» не равно «не храним ваши данные». хранение и обработка остаются — поэтому матрица выше не отменяется настройками, а работает вместе с ними.

обезличивание: скучный приём, закрывающий большинство вопросов

принцип простой: модели, чтобы помочь, почти никогда не нужны реальные имена и цифры.

задача «напиши ответ клиенту иванову из компании ромашка, который недоволен задержкой заказа на 340 000 ₽» решается моделью ровно так же хорошо в виде «напиши ответ клиенту, недовольному задержкой крупного заказа». подставить имя обратно — секунда работы человека. а в промпте не осталось ничего, что было бы жалко потерять.

на уровне процессов это выглядит так:

  • в шаблонах промптов вместо реальных данных — плейсхолдеры вида [имя], [сумма], [компания];
  • в автоматизациях обезличивание встраивается до отправки в модель: агент подставляет данные из crm уже после генерации, на своей стороне;
  • аналитика уезжает в модель агрегатами («сегмент a, 120 клиентов, средний чек такой-то»), а не выгрузкой строк.

в моих внедрениях это стандартная часть архитектуры агента, а не опция за отдельные деньги: модель видит суть задачи, реальные поля живут в ваших системах.

локальные модели: когда действительно нужны

локальная модель — это модель, работающая на вашем сервере: данные не покидают контур вообще. звучит как идеальное решение, поэтому честно о цене вопроса.

когда оправданно: медицина, финансы, юридические данные под жёстким регулированием; коммерческая тайна, утечка которой стоит дороже инфраструктуры; корпоративные политики, прямо запрещающие внешние api; регулярная обработка больших объёмов персональных данных.

какая цена: сервер с gpu — либо своё железо от ~500к, либо аренда от ~50–150к в месяц; открытые модели ? llama, qwen, deepseek и другие — в 2026 они закрывают большинство типовых бизнес-задач, хотя топовым облачным всё ещё уступают на сложных. заметно догнали облачные, но на сложных задачах разница остаётся; нужен человек, который это поддерживает.

когда не оправданно: «на всякий случай». если данные можно обезличить — обезличенные данные в облачном api через корпоративный тариф дают лучше качество за меньшие деньги. локальная модель ради душевного спокойствия — это 500к+ за спокойствие, которое дал бы регламент на одну страницу.

частые вопросы

наши переписки читают живые люди?

в норме — нет. исключения: жалобы на нарушение правил и отладка инцидентов, и это описано в политиках провайдеров. системного «оператор читает ваши чаты» не существует — на корпоративных тарифах тем более.

русские данные в западные модели — это вообще законно?

если в данных нет персональных данных россиян — вопросов почти нет. если есть — начинается территория 152-фз, и это отдельная большая тема: разбираю её в статье про нейросети и 152-фз. короткая версия: обезличивайте либо используйте российские модели для этого контура.

достаточно ли просто запретить сотрудникам нейросети?

нет, и это худший вариант из возможных: пользоваться продолжат, только тайно и с личных аккаунтов — вы потеряете даже видимость контроля. рабочая схема обратная: дать официальный корпоративный доступ с правильными настройками и одну страницу правил, что туда можно отправлять.

коротко

  • бояться нужно не нейросетей, а бесконтрольности: главная дыра — личные аккаунты сотрудников, а не серверы провайдеров.
  • матрица простая: публичное — свободно; операционка — через корпоративный тариф или api; персональные данные и тайна — обезличивать; пароли и базы — никогда и никуда.
  • настройки не-обучения — пять минут. обезличивание — привычка. локальные модели — для регулируемых отраслей, не «на всякий случай».