отвечаю в первом абзаце: отправлять данные компании в нейросети можно, если понимать, какие именно данные, через какой канал и с какими настройками. обезличенную операционку — спокойно. коммерческую тайну и персональные данные клиентов — только через api с отключённым обучением или через локальные модели, и то после обезличивания. пароли, ключи и полные базы клиентов — никуда и никогда, ни при каких настройках. а самый реальный риск утечки в 2026 году — не «openai украдёт вашу стратегию», а ваш же сотрудник, который с личного аккаунта вставляет в chatgpt договор с клиентом, потому что ему никто не объяснил, что так нельзя. дальше — матрица по типам данных, настройки по шагам и когда действительно нужна локальная модель.
как данные вообще утекают — три сценария
чтобы не бояться всего подряд, полезно понимать механику. реальных сценария три:
- данные попадают в обучение. бесплатные и личные версии chatgpt по умолчанию могут использовать переписку для обучения моделей. это значит: теоретически фрагмент вашего текста однажды может всплыть в чужом ответе. вероятность конкретной утечки мизерная, но для коммерческой тайны «мизерная» — не аргумент.
- данные лежат на чужих серверах. даже без обучения переписка хранится у провайдера. взломают провайдера, придёт запрос от регулятора чужой юрисдикции, сотрудник провайдера ошибётся — сценарии маловероятные, но ненулевые. вопрос не «утечёт ли», а «что именно там лежит, если утечёт».
- данные утекают по-старинке. сотрудник скинул выгрузку клиентов в личный gpt, уволился и унёс аккаунт с историей. никакая модель тут не виновата — это классическая дыра в процессах, просто с новым инструментом.
третий сценарий в практике встречается на порядок чаще первых двух. запомним это — вернёмся в конце.
матрица: что можно, что с оговорками, что нельзя
| данные | личный chatgpt / бесплатные боты | api / корпоративный тариф с отключённым обучением | локальная модель |
|---|---|---|---|
| публичная информация: тексты с сайта, вакансии, посты | можно | можно | можно |
| внутренняя операционка без имён: регламенты, шаблоны, черновики | можно, но лучше не надо | можно | можно |
| обезличенные данные клиентов: «клиент n спросил про доставку» | нельзя | можно | можно |
| персональные данные: имена, телефоны, почты клиентов | нельзя | с оговорками — только при реальной необходимости и с обезличиванием всего лишнего | можно |
| коммерческая тайна: цены закупки, маржа, стратегия, m&a | нельзя | с оговорками — оцените цену утечки | предпочтительно |
| пароли, api-ключи, доступы, полные выгрузки базы клиентов | никогда | никогда | тоже нет — им в промптах вообще нечего делать |
главная строка этой таблицы — последняя. пароли и ключи не «рискованно отправлять» — их отправлять бессмысленно: ни одна задача для нейросети не требует настоящего пароля. если ключ оказался в промпте, это ошибка процесса, а не вопрос доверия к провайдеру.
настройки не-обучения: пять минут на весь эффект
самое дешёвое улучшение безопасности из возможных:
- chatgpt: настройки → data controls → выключить «improve the model for everyone». в командном и enterprise-тарифах обучение на ваших данных выключено по умолчанию — это одна из главных причин платить за team, а не раздавать личные аккаунты.
- claude: обучение на пользовательских данных по умолчанию не ведётся на корпоративных тарифах; в личных настройках проверьте раздел privacy. api-трафик для обучения не используется.
- api вместо чата. всё, что автоматизировано (агенты, интеграции), ходит через api — а api-данные крупные провайдеры не используют для обучения. типовой агент в этом смысле безопаснее, чем сотрудник с чатом.
- зафиксируйте письменно, какой тариф и какие настройки у вас приняты. не для бюрократии — для нового сотрудника, который завтра принесёт личный аккаунт.
важная оговорка: «не обучаемся на ваших данных» не равно «не храним ваши данные». хранение и обработка остаются — поэтому матрица выше не отменяется настройками, а работает вместе с ними.
обезличивание: скучный приём, закрывающий большинство вопросов
принцип простой: модели, чтобы помочь, почти никогда не нужны реальные имена и цифры.
задача «напиши ответ клиенту иванову из компании ромашка, который недоволен задержкой заказа на 340 000 ₽» решается моделью ровно так же хорошо в виде «напиши ответ клиенту, недовольному задержкой крупного заказа». подставить имя обратно — секунда работы человека. а в промпте не осталось ничего, что было бы жалко потерять.
на уровне процессов это выглядит так:
- в шаблонах промптов вместо реальных данных — плейсхолдеры вида [имя], [сумма], [компания];
- в автоматизациях обезличивание встраивается до отправки в модель: агент подставляет данные из crm уже после генерации, на своей стороне;
- аналитика уезжает в модель агрегатами («сегмент a, 120 клиентов, средний чек такой-то»), а не выгрузкой строк.
в моих внедрениях это стандартная часть архитектуры агента, а не опция за отдельные деньги: модель видит суть задачи, реальные поля живут в ваших системах.
локальные модели: когда действительно нужны
локальная модель — это модель, работающая на вашем сервере: данные не покидают контур вообще. звучит как идеальное решение, поэтому честно о цене вопроса.
когда оправданно: медицина, финансы, юридические данные под жёстким регулированием; коммерческая тайна, утечка которой стоит дороже инфраструктуры; корпоративные политики, прямо запрещающие внешние api; регулярная обработка больших объёмов персональных данных.
какая цена: сервер с gpu — либо своё железо от ~500к, либо аренда от ~50–150к в месяц; открытые модели ? llama, qwen, deepseek и другие — в 2026 они закрывают большинство типовых бизнес-задач, хотя топовым облачным всё ещё уступают на сложных. заметно догнали облачные, но на сложных задачах разница остаётся; нужен человек, который это поддерживает.
когда не оправданно: «на всякий случай». если данные можно обезличить — обезличенные данные в облачном api через корпоративный тариф дают лучше качество за меньшие деньги. локальная модель ради душевного спокойствия — это 500к+ за спокойствие, которое дал бы регламент на одну страницу.
частые вопросы
наши переписки читают живые люди?
в норме — нет. исключения: жалобы на нарушение правил и отладка инцидентов, и это описано в политиках провайдеров. системного «оператор читает ваши чаты» не существует — на корпоративных тарифах тем более.
русские данные в западные модели — это вообще законно?
если в данных нет персональных данных россиян — вопросов почти нет. если есть — начинается территория 152-фз, и это отдельная большая тема: разбираю её в статье про нейросети и 152-фз. короткая версия: обезличивайте либо используйте российские модели для этого контура.
достаточно ли просто запретить сотрудникам нейросети?
нет, и это худший вариант из возможных: пользоваться продолжат, только тайно и с личных аккаунтов — вы потеряете даже видимость контроля. рабочая схема обратная: дать официальный корпоративный доступ с правильными настройками и одну страницу правил, что туда можно отправлять.
коротко
- бояться нужно не нейросетей, а бесконтрольности: главная дыра — личные аккаунты сотрудников, а не серверы провайдеров.
- матрица простая: публичное — свободно; операционка — через корпоративный тариф или api; персональные данные и тайна — обезличивать; пароли и базы — никогда и никуда.
- настройки не-обучения — пять минут. обезличивание — привычка. локальные модели — для регулируемых отраслей, не «на всякий случай».