Локальная нейросеть для бизнеса и 152-ФЗ: сервер, облако РФ или API
Локальная нейросеть для бизнеса — это языковая модель, которая работает там, где вы контролируете данные: на своём сервере или хотя бы на серверах в России, а не у зарубежного провайдера. Спрос на такие решения растёт не из любви к железу, а из-за персональных данных. Когда в запрос к модели попадают паспорт клиента, диагноз, телефон или скан документа, выбор «куда отправить текст» становится юридическим вопросом, а не только техническим.
Разбираем три реальных варианта — свой сервер, российское облако с открытыми моделями и зарубежный API: что говорит 152-ФЗ, во что обходится каждый путь и где открытые модели проседают по качеству. Что такое LLM в принципе, мы уже разбирали в статье о больших языковых моделях, здесь — только выбор места, где модель работает.
Почему выбор места для нейросети упирается в персональные данные
Для закона неважно, что внутри — нейросеть, CRM или таблица. Если вы передаёте во внешний сервис информацию, по которой можно определить человека, это обработка персональных данных, и у неё должны быть основание, место и порядок. Запрос к модели с ФИО и номером полиса — такая же передача данных, как выгрузка базы подрядчику.
Отсюда три вопроса, которые стоит задать до выбора модели:
- попадают ли в запросы персональные данные клиентов или сотрудников — сейчас или после масштабирования;
- где физически находится сервер, который обрабатывает запрос, и чья это юрисдикция;
- кто ещё видит запросы: логи провайдера, его подрядчики, служба поддержки.
Если персональных данных в запросах нет и не будет — например, модель пишет описания товаров, — большая часть статьи вас не касается: берите самый удобный вариант по качеству и цене. Всё интересное начинается, когда модель читает документы и общается с клиентами.
152-ФЗ и нейросети в 2026 году: локализация и трансграничная передача
Локализация: первичная база — только в России
Часть 5 статьи 18 закона «О персональных данных» в редакции закона № 23-ФЗ, действующей с 1 июля 2025 года, прямо запрещает при сборе данных граждан России записывать, систематизировать, накапливать, хранить, уточнять и извлекать их с использованием баз данных за пределами РФ (за узкими исключениями). Для ИИ-проектов вывод практический: если бот принимает данные клиента, они сначала должны лечь в вашу российскую базу, а не «жить» только в истории диалогов зарубежного сервиса.
Штраф для юрлица за невыполнение обязанности по локализации — от 1 до 6 млн ₽, за повторное нарушение — от 6 до 18 млн ₽ (части 8 и 9 статьи 13.11 КоАП). Отдельные и куда более крупные штрафы, вплоть до оборотных, — за утечки; их мы подробно разбирали в статье об оборотных штрафах за утечку персональных данных.
Трансграничная передача: уведомление РКН до начала
Отправка персональных данных в модель, которая работает за рубежом, — трансграничная передача. Порядок задаёт статья 12 того же закона:
- До подачи уведомления оператор получает от иностранного получателя сведения о мерах защиты данных и условиях прекращения обработки, а если страны нет в перечне Роскомнадзора — ещё и о правовом регулировании в этой стране.
- До начала передачи оператор направляет в Роскомнадзор отдельное уведомление о намерении передавать данные за рубеж — оно не заменяет обычное уведомление об обработке персональных данных.
- Если страна входит в перечень государств с адекватной защитой, передавать можно сразу после подачи уведомления. Если не входит — только после истечения 10 рабочих дней на рассмотрение (срок приостанавливается, если РКН запросит сведения). Запретить или ограничить передачу Роскомнадзор вправе в обоих случаях.
После поправок закона № 265-ФЗ от 26.07.2026 режим определяется только одним критерием — включена ли страна в перечень Роскомнадзора. США в этом перечне нет, поэтому для американских API действует самый строгий вариант: сбор сведений от получателя, уведомление и ожидание решения.
Вариант 1: свой сервер с открытой моделью
Максимальный контроль: модель и данные не покидают ваш контур, сервер можно вообще отключить от интернета. Берут открытые модели с разрешающей лицензией — семейства Qwen, DeepSeek, Gemma, gpt-oss и другие, — и запускают через серверы инференса вроде vLLM или Ollama. Внутренние системы обращаются к модели по API внутри сети.
Какие LLM можно развернуть локально и сколько нужно видеопамяти
Главный ресурс — видеопамять (VRAM): модель должна целиком поместиться в неё вместе с контекстом диалога. Квантизация (сжатие весов до 4–8 бит) снижает требования в 2–4 раза ценой небольшой потери качества.
| Размер модели | VRAM в 4-битной квантизации | Типичное железо | Для каких задач |
|---|---|---|---|
| 7–8 млрд параметров | около 6–8 ГБ | одна карта 12–16 ГБ | классификация, короткие ответы |
| 14 млрд | около 10–12 ГБ | одна карта 16–24 ГБ | извлечение данных, простые диалоги |
| 27–35 млрд | около 20–24 ГБ | одна карта 24–32 ГБ | ассистенты, разбор документов |
| 70 млрд | около 40–48 ГБ | две карты по 24–32 ГБ или одна 48–96 ГБ | сложные рассуждения, длинный контекст |
К весам добавляйте запас на контекст и служебную память: на длинных документах он легко съедает ещё несколько гигабайт. Хорошая новость 2026 года — MoE-модели вроде Qwen3.6-35B-A3B: из 35 млрд параметров на каждый токен работает около 3 млрд, поэтому модель быстро отвечает на одной карте.
Сервер для локальной LLM: сколько стоит
Ориентир рынка на сентябрь 2026 года: RTX 5090 с 32 ГБ в России стоит примерно 350–650 тыс. ₽ в зависимости от поставщика, топовые версии дороже. Сборка на двух таких картах под модели уровня 70B с процессором, памятью, дисками и блоком питания на 2,5–3 кВт — от 1–1,5 млн ₽, серверные платформы с профессиональными картами — кратно дороже. Альтернатива покупке — аренда GPU у российских провайдеров: A100 — от ~220 ₽, H100 — от ~350 ₽ в час, при круглосуточной работе это 150–260 тыс. ₽ в месяц (ориентир, цены меняются).
Но железо — меньшая часть расходов. Нужны настройка сервера, обновления, мониторинг, резервирование, разграничение доступа и журналирование запросов — эту работу обычно закрывают в рамках настройки и сопровождения сервера. Свой сервер окупается при большом и ровном потоке запросов или когда данные нельзя выпускать из контура в принципе.
Вариант 2: российское облако с открытыми моделями
Средняя дорога, которую часто упускают из виду. Российские облака дают те же открытые модели по API: например, в Model Gallery Yandex AI Studio доступны Qwen, DeepSeek, Gemma, gpt-oss и собственные модели Яндекса. Серверы находятся в России, железо и обновления — забота провайдера, а платите вы за токены. Стоимость открытых моделей — доли рубля за 1000 токенов, актуальные цены смотрите в прайсе Yandex AI Studio.
Для типичной нагрузки малого и среднего бизнеса — сотни и тысячи документов или диалогов в месяц — это на порядки дешевле собственного GPU-сервера: вы не платите за простаивающее железо и инженера, который его обслуживает. По нашему опыту, лучшая из открытых моделей, доступных там, — Qwen 3.6, хотя она уже не самая новая.
Что оформить по закону
Российское облако — не «свой контур», а обработка данных другим лицом по вашему поручению. По части 3 статьи 6 152-ФЗ поручить обработку другому лицу можно с согласия субъекта (если закон не предусматривает иного) и на основании договора. В нём определяются перечень данных, действия с ними, цели, обязанность соблюдать конфиденциальность, локализацию по ч. 5 ст. 18 и требования к защите. Ответственность перед клиентом за действия провайдера при этом несёте вы.
Вариант 3: зарубежный API — когда допустим
Зарубежные модели по-прежнему сильнее открытых в сложных рассуждениях, и отказываться от них целиком не обязательно. Они подходят, когда персональных данных в запросах нет: генерация текстов, анализ обезличенной статистики, код, внутренние документы без сведений о людях.
Если данные всё же нужны, остаются два пути: пройти процедуру трансграничной передачи по статье 12 (сведения от получателя, уведомление, ожидание для стран вне перечня) или обезличивать данные до отправки. Во втором случае система заменяет ФИО, телефоны и номера документов на метки, модель работает с текстом без персональных данных, а метки подставляются обратно уже в вашем контуре.
Свой сервер, облако РФ или зарубежный API: сравнение
| Критерий | Свой сервер | Облако РФ с открытыми моделями | Зарубежный API |
|---|---|---|---|
| Где данные | в вашем контуре | в России, у провайдера | за рубежом |
| Что оформить | внутренние меры защиты | поручение обработки, проверка провайдера | сведения от получателя, уведомление РКН, ожидание для стран вне перечня |
| Стартовые затраты | сотни тысяч — миллионы ₽ на железо | практически нет | практически нет |
| Текущие расходы | электричество, администрирование, амортизация | токены по факту | токены по факту, оплата из РФ затруднена |
| Качество моделей | открытые, ограничено вашим железом | открытые, включая крупные | самые сильные на рынке |
Наш опыт: Qwen на реальных задачах с персональными данными
Два проекта, где персональные данные — суть задачи, а не побочный эффект.
ИИ-бот для оформления ОСАГО. Клиент присылает фото двух документов — модель на Qwen распознаёт их, собирает нужные для полиса данные, и полис оформляется через API страховой компании. По фото весь цикл занимает около 5 секунд. Если фото нет, бот собирает те же данные опросом в диалоге. По сути это ИИ-агент: он не только распознаёт документы, но и выполняет действие во внешней системе.
Проверка диплома врача на медицинском портале. Врач загружает скан диплома, модель Qwen 3.6 извлекает данные для верификации. Модель сносно читает даже рукописный текст в дипломах.
Почему открытая модель «не самая умная» и как это компенсировать
Честно: открытые модели уступают флагманам в свободном диалоге. Модель в проекте ОСАГО — не самая умная, и чтобы бот работал надёжно, нам пришлось добавить три вещи:
- Сценарии диалога. Модель ведёт разговор не «как хочет», а по прописанным шагам: что спросить, в каком порядке, что делать при отказе или неясном ответе.
- Примеры диалогов. В инструкцию модели добавлены образцы правильных разговоров, в том числе трудных случаев — так поведение становится предсказуемым.
- Программные валидации. Всё, что можно проверить кодом, проверяется кодом — например, форматы номеров документов, даты и согласованность данных между документами. Модель извлекает и предлагает, код подтверждает.
Вывод, который мы переносим во все проекты: качество ИИ-системы определяется не только моделью, а обвязкой вокруг неё. Более слабая модель в хорошо спроектированной системе надёжнее сильной модели «как есть». Если ответы должны опираться на ваши документы, добавляется поиск по базе знаний — подробнее о подходах в статье о промптах, RAG и дообучении.
Типовые ошибки при выборе локальной нейросети
- Покупка сервера до пилота. Сначала проверьте качество выбранной модели на ваших данных в облаке РФ — это стоит копейки. Железо покупают, когда понятны модель, нагрузка и экономика.
- «Российский сервер — значит, всё законно». Облако в РФ снимает вопрос трансграничной передачи, но не отменяет поручения обработки, оснований и мер защиты.
- Нет правил для сотрудников. Корпоративная модель есть, а люди продолжают пользоваться зарубежными чат-ботами с личных аккаунтов. Нужны регламент и доступный внутренний инструмент.
- Модель без обвязки. Ожидание, что модель «сама разберётся», заканчивается ошибками в данных. Сценарии, примеры и проверки кодом — обязательная часть проекта.
- Логи как новая утечка. Запросы и ответы с персональными данными оседают в журналах — их тоже нужно защищать, ограничивать доступ и удалять по сроку.
Чек-лист: как выбрать вариант размещения
- Определите, попадают ли в запросы персональные данные и каких категорий.
- Проверьте, что первичная запись данных клиентов идёт в базу на территории России.
- Нет персональных данных — выбирайте модель по качеству и цене, включая зарубежные.
- Есть персональные данные — начните с открытой модели в российском облаке и оформите поручение обработки.
- Уточните у провайдера логирование запросов и документы о соответствии 152-ФЗ.
- Зарубежный API с персональными данными — только после процедуры по статье 12 или с обезличиванием до отправки.
- Проведите пилот на реальных документах и замерьте точность до масштабирования.
- Заложите сценарии, примеры диалогов и программные проверки данных.
- Свой сервер рассматривайте при большом стабильном потоке или требовании полностью закрытого контура.
- Введите регламент для сотрудников: какие данные и в какие сервисы можно передавать.
Итог
Для большинства компаний с персональными данными разумный старт в 2026 году — открытая модель вроде Qwen в российском облаке: данные остаются в РФ, затраты идут по факту, а качество подтягивается сценариями и проверками кодом. Свой сервер оправдан при большой нагрузке или требовании полной изоляции, зарубежный API — для задач без персональных данных или с обезличиванием. Если нужно разобрать ваш процесс и выбрать схему, это типичная первая задача при внедрении ИИ в бизнес.
Поможем с этой задачей под ключ — от идеи до результата.
Заказать услугу