Написать нам в TelegramНаписать нам в Max
TelegramMax

Локальная нейросеть для бизнеса и 152-ФЗ: сервер, облако РФ или API

Разработка
26 сентября 2026 г.
Фото Максим Козлов
Максим КозловРуководитель отдела разработки

Локальная нейросеть для бизнеса — это языковая модель, которая работает там, где вы контролируете данные: на своём сервере или хотя бы на серверах в России, а не у зарубежного провайдера. Спрос на такие решения растёт не из любви к железу, а из-за персональных данных. Когда в запрос к модели попадают паспорт клиента, диагноз, телефон или скан документа, выбор «куда отправить текст» становится юридическим вопросом, а не только техническим.

Разбираем три реальных варианта — свой сервер, российское облако с открытыми моделями и зарубежный API: что говорит 152-ФЗ, во что обходится каждый путь и где открытые модели проседают по качеству. Что такое LLM в принципе, мы уже разбирали в статье о больших языковых моделях, здесь — только выбор места, где модель работает.

Почему выбор места для нейросети упирается в персональные данные

Для закона неважно, что внутри — нейросеть, CRM или таблица. Если вы передаёте во внешний сервис информацию, по которой можно определить человека, это обработка персональных данных, и у неё должны быть основание, место и порядок. Запрос к модели с ФИО и номером полиса — такая же передача данных, как выгрузка базы подрядчику.

Отсюда три вопроса, которые стоит задать до выбора модели:

  • попадают ли в запросы персональные данные клиентов или сотрудников — сейчас или после масштабирования;
  • где физически находится сервер, который обрабатывает запрос, и чья это юрисдикция;
  • кто ещё видит запросы: логи провайдера, его подрядчики, служба поддержки.

Если персональных данных в запросах нет и не будет — например, модель пишет описания товаров, — большая часть статьи вас не касается: берите самый удобный вариант по качеству и цене. Всё интересное начинается, когда модель читает документы и общается с клиентами.

152-ФЗ и нейросети в 2026 году: локализация и трансграничная передача

Локализация: первичная база — только в России

Часть 5 статьи 18 закона «О персональных данных» в редакции закона № 23-ФЗ, действующей с 1 июля 2025 года, прямо запрещает при сборе данных граждан России записывать, систематизировать, накапливать, хранить, уточнять и извлекать их с использованием баз данных за пределами РФ (за узкими исключениями). Для ИИ-проектов вывод практический: если бот принимает данные клиента, они сначала должны лечь в вашу российскую базу, а не «жить» только в истории диалогов зарубежного сервиса.

Штраф для юрлица за невыполнение обязанности по локализации — от 1 до 6 млн ₽, за повторное нарушение — от 6 до 18 млн ₽ (части 8 и 9 статьи 13.11 КоАП). Отдельные и куда более крупные штрафы, вплоть до оборотных, — за утечки; их мы подробно разбирали в статье об оборотных штрафах за утечку персональных данных.

Трансграничная передача: уведомление РКН до начала

Отправка персональных данных в модель, которая работает за рубежом, — трансграничная передача. Порядок задаёт статья 12 того же закона:

  1. До подачи уведомления оператор получает от иностранного получателя сведения о мерах защиты данных и условиях прекращения обработки, а если страны нет в перечне Роскомнадзора — ещё и о правовом регулировании в этой стране.
  2. До начала передачи оператор направляет в Роскомнадзор отдельное уведомление о намерении передавать данные за рубеж — оно не заменяет обычное уведомление об обработке персональных данных.
  3. Если страна входит в перечень государств с адекватной защитой, передавать можно сразу после подачи уведомления. Если не входит — только после истечения 10 рабочих дней на рассмотрение (срок приостанавливается, если РКН запросит сведения). Запретить или ограничить передачу Роскомнадзор вправе в обоих случаях.

После поправок закона № 265-ФЗ от 26.07.2026 режим определяется только одним критерием — включена ли страна в перечень Роскомнадзора. США в этом перечне нет, поэтому для американских API действует самый строгий вариант: сбор сведений от получателя, уведомление и ожидание решения.

Самый частый сценарий нарушения — не продуманный проект, а сотрудник, который вставил скан паспорта клиента в зарубежный чат-бот «чтобы быстрее разобрать». Формально это трансграничная передача без уведомления и без сведений от получателя. Согласие клиента уведомление не заменяет.

Вариант 1: свой сервер с открытой моделью

Максимальный контроль: модель и данные не покидают ваш контур, сервер можно вообще отключить от интернета. Берут открытые модели с разрешающей лицензией — семейства Qwen, DeepSeek, Gemma, gpt-oss и другие, — и запускают через серверы инференса вроде vLLM или Ollama. Внутренние системы обращаются к модели по API внутри сети.

Какие LLM можно развернуть локально и сколько нужно видеопамяти

Главный ресурс — видеопамять (VRAM): модель должна целиком поместиться в неё вместе с контекстом диалога. Квантизация (сжатие весов до 4–8 бит) снижает требования в 2–4 раза ценой небольшой потери качества.

Размер моделиVRAM в 4-битной квантизацииТипичное железоДля каких задач
7–8 млрд параметровоколо 6–8 ГБодна карта 12–16 ГБклассификация, короткие ответы
14 млрдоколо 10–12 ГБодна карта 16–24 ГБизвлечение данных, простые диалоги
27–35 млрдоколо 20–24 ГБодна карта 24–32 ГБассистенты, разбор документов
70 млрдоколо 40–48 ГБдве карты по 24–32 ГБ или одна 48–96 ГБсложные рассуждения, длинный контекст

К весам добавляйте запас на контекст и служебную память: на длинных документах он легко съедает ещё несколько гигабайт. Хорошая новость 2026 года — MoE-модели вроде Qwen3.6-35B-A3B: из 35 млрд параметров на каждый токен работает около 3 млрд, поэтому модель быстро отвечает на одной карте.

Сервер для локальной LLM: сколько стоит

Ориентир рынка на сентябрь 2026 года: RTX 5090 с 32 ГБ в России стоит примерно 350–650 тыс. ₽ в зависимости от поставщика, топовые версии дороже. Сборка на двух таких картах под модели уровня 70B с процессором, памятью, дисками и блоком питания на 2,5–3 кВт — от 1–1,5 млн ₽, серверные платформы с профессиональными картами — кратно дороже. Альтернатива покупке — аренда GPU у российских провайдеров: A100 — от ~220 ₽, H100 — от ~350 ₽ в час, при круглосуточной работе это 150–260 тыс. ₽ в месяц (ориентир, цены меняются).

Но железо — меньшая часть расходов. Нужны настройка сервера, обновления, мониторинг, резервирование, разграничение доступа и журналирование запросов — эту работу обычно закрывают в рамках настройки и сопровождения сервера. Свой сервер окупается при большом и ровном потоке запросов или когда данные нельзя выпускать из контура в принципе.

Вариант 2: российское облако с открытыми моделями

Средняя дорога, которую часто упускают из виду. Российские облака дают те же открытые модели по API: например, в Model Gallery Yandex AI Studio доступны Qwen, DeepSeek, Gemma, gpt-oss и собственные модели Яндекса. Серверы находятся в России, железо и обновления — забота провайдера, а платите вы за токены. Стоимость открытых моделей — доли рубля за 1000 токенов, актуальные цены смотрите в прайсе Yandex AI Studio.

Для типичной нагрузки малого и среднего бизнеса — сотни и тысячи документов или диалогов в месяц — это на порядки дешевле собственного GPU-сервера: вы не платите за простаивающее железо и инженера, который его обслуживает. По нашему опыту, лучшая из открытых моделей, доступных там, — Qwen 3.6, хотя она уже не самая новая.

Что оформить по закону

Российское облако — не «свой контур», а обработка данных другим лицом по вашему поручению. По части 3 статьи 6 152-ФЗ поручить обработку другому лицу можно с согласия субъекта (если закон не предусматривает иного) и на основании договора. В нём определяются перечень данных, действия с ними, цели, обязанность соблюдать конфиденциальность, локализацию по ч. 5 ст. 18 и требования к защите. Ответственность перед клиентом за действия провайдера при этом несёте вы.

Перед запуском проверьте и отключите логирование запросов (в Yandex AI Studio это делается в настройках — так рекомендует сам Яндекс) и запросите у провайдера документы о соответствии 152-ФЗ. Это вопрос одного письма в поддержку, а снимает он главный риск облачного варианта.

Вариант 3: зарубежный API — когда допустим

Зарубежные модели по-прежнему сильнее открытых в сложных рассуждениях, и отказываться от них целиком не обязательно. Они подходят, когда персональных данных в запросах нет: генерация текстов, анализ обезличенной статистики, код, внутренние документы без сведений о людях.

Если данные всё же нужны, остаются два пути: пройти процедуру трансграничной передачи по статье 12 (сведения от получателя, уведомление, ожидание для стран вне перечня) или обезличивать данные до отправки. Во втором случае система заменяет ФИО, телефоны и номера документов на метки, модель работает с текстом без персональных данных, а метки подставляются обратно уже в вашем контуре.

Гибридная схема часто оказывается оптимальной: всё, где есть персональные данные, обрабатывает модель в РФ, а сложные задачи на обезличенных данных уходят в сильную зарубежную модель. Маршрутизацию по типу запроса закладывают на этапе архитектуры.

Свой сервер, облако РФ или зарубежный API: сравнение

КритерийСвой серверОблако РФ с открытыми моделямиЗарубежный API
Где данныев вашем контурев России, у провайдераза рубежом
Что оформитьвнутренние меры защитыпоручение обработки, проверка провайдерасведения от получателя, уведомление РКН, ожидание для стран вне перечня
Стартовые затратысотни тысяч — миллионы ₽ на железопрактически нетпрактически нет
Текущие расходыэлектричество, администрирование, амортизациятокены по фактутокены по факту, оплата из РФ затруднена
Качество моделейоткрытые, ограничено вашим железомоткрытые, включая крупныесамые сильные на рынке

Наш опыт: Qwen на реальных задачах с персональными данными

Два проекта, где персональные данные — суть задачи, а не побочный эффект.

ИИ-бот для оформления ОСАГО. Клиент присылает фото двух документов — модель на Qwen распознаёт их, собирает нужные для полиса данные, и полис оформляется через API страховой компании. По фото весь цикл занимает около 5 секунд. Если фото нет, бот собирает те же данные опросом в диалоге. По сути это ИИ-агент: он не только распознаёт документы, но и выполняет действие во внешней системе.

Проверка диплома врача на медицинском портале. Врач загружает скан диплома, модель Qwen 3.6 извлекает данные для верификации. Модель сносно читает даже рукописный текст в дипломах.

Почему открытая модель «не самая умная» и как это компенсировать

Честно: открытые модели уступают флагманам в свободном диалоге. Модель в проекте ОСАГО — не самая умная, и чтобы бот работал надёжно, нам пришлось добавить три вещи:

  • Сценарии диалога. Модель ведёт разговор не «как хочет», а по прописанным шагам: что спросить, в каком порядке, что делать при отказе или неясном ответе.
  • Примеры диалогов. В инструкцию модели добавлены образцы правильных разговоров, в том числе трудных случаев — так поведение становится предсказуемым.
  • Программные валидации. Всё, что можно проверить кодом, проверяется кодом — например, форматы номеров документов, даты и согласованность данных между документами. Модель извлекает и предлагает, код подтверждает.

Вывод, который мы переносим во все проекты: качество ИИ-системы определяется не только моделью, а обвязкой вокруг неё. Более слабая модель в хорошо спроектированной системе надёжнее сильной модели «как есть». Если ответы должны опираться на ваши документы, добавляется поиск по базе знаний — подробнее о подходах в статье о промптах, RAG и дообучении.

Типовые ошибки при выборе локальной нейросети

  • Покупка сервера до пилота. Сначала проверьте качество выбранной модели на ваших данных в облаке РФ — это стоит копейки. Железо покупают, когда понятны модель, нагрузка и экономика.
  • «Российский сервер — значит, всё законно». Облако в РФ снимает вопрос трансграничной передачи, но не отменяет поручения обработки, оснований и мер защиты.
  • Нет правил для сотрудников. Корпоративная модель есть, а люди продолжают пользоваться зарубежными чат-ботами с личных аккаунтов. Нужны регламент и доступный внутренний инструмент.
  • Модель без обвязки. Ожидание, что модель «сама разберётся», заканчивается ошибками в данных. Сценарии, примеры и проверки кодом — обязательная часть проекта.
  • Логи как новая утечка. Запросы и ответы с персональными данными оседают в журналах — их тоже нужно защищать, ограничивать доступ и удалять по сроку.

Чек-лист: как выбрать вариант размещения

  • Определите, попадают ли в запросы персональные данные и каких категорий.
  • Проверьте, что первичная запись данных клиентов идёт в базу на территории России.
  • Нет персональных данных — выбирайте модель по качеству и цене, включая зарубежные.
  • Есть персональные данные — начните с открытой модели в российском облаке и оформите поручение обработки.
  • Уточните у провайдера логирование запросов и документы о соответствии 152-ФЗ.
  • Зарубежный API с персональными данными — только после процедуры по статье 12 или с обезличиванием до отправки.
  • Проведите пилот на реальных документах и замерьте точность до масштабирования.
  • Заложите сценарии, примеры диалогов и программные проверки данных.
  • Свой сервер рассматривайте при большом стабильном потоке или требовании полностью закрытого контура.
  • Введите регламент для сотрудников: какие данные и в какие сервисы можно передавать.

Итог

Для большинства компаний с персональными данными разумный старт в 2026 году — открытая модель вроде Qwen в российском облаке: данные остаются в РФ, затраты идут по факту, а качество подтягивается сценариями и проверками кодом. Свой сервер оправдан при большой нагрузке или требовании полной изоляции, зарубежный API — для задач без персональных данных или с обезличиванием. Если нужно разобрать ваш процесс и выбрать схему, это типичная первая задача при внедрении ИИ в бизнес.

Частые вопросы
Согласие не заменяет процедуру трансграничной передачи. Оператор должен получить сведения от иностранного получателя, заранее уведомить Роскомнадзор, а для стран вне перечня с адекватной защитой, куда входят и США, — дождаться окончания срока рассмотрения уведомления. Проще обезличивать данные до отправки или использовать модель в России.
Нет. После загрузки весов модель работает полностью офлайн, сервер можно изолировать от внешней сети. Интернет нужен только для обновлений, их можно переносить вручную.
Для моделей до 30–35 млрд параметров в 4-битной квантизации обычно хватает одной карты на 24–32 ГБ, особенно для MoE-моделей вроде Qwen3.6-35B-A3B. Для моделей около 70 млрд нужны две карты или одна профессиональная с 48 ГБ и больше. Многое зависит от длины контекста и числа одновременных пользователей.
Да, серверы находятся в РФ, поэтому трансграничной передачи нет. Но это обработка по вашему поручению: нужен договор с провайдером с условиями о конфиденциальности и защите, основание обработки и проверка настроек логирования. Ответственность перед клиентами остаётся на вас.
При такой нагрузке облако с открытыми моделями почти всегда дешевле: вы платите доли рубля за 1000 токенов вместо сотен тысяч рублей за железо и расходов на его обслуживание. Свой сервер начинает окупаться при большом ровном потоке запросов или когда требуется полностью закрытый контур.
Чаще всего нет. Для извлечения данных из документов и типовых диалогов хватает хорошей инструкции, примеров диалогов и проверок кодом, а для ответов по внутренним документам — поиска по базе знаний. Дообучение имеет смысл, когда эти методы исчерпаны и есть качественный набор размеченных примеров.
Внедрение искусственного интеллекта

Поможем с этой задачей под ключ — от идеи до результата.

Заказать услугу
Услуги по теме
Внедряем искусственный интеллект в бизнес под ключ: начинаем с диагностики ваших процессов, отбираем задачи с понятным эффектом, подбираем модель (GPT, YandexGPT, GigaChat), собираем RAG по вашей базе знаний и интеграции, проходим путь пилот → продакшн с замером ROI. Не «коробка с ИИ», а инженерное решение на вашем коде — исходники остаются у вас.
Проектируем и внедряем автономные AI-агенты для бизнеса, которые сами выполняют многошаговые задачи: читают данные, ходят в ваши системы через function calling, отвечают по базе знаний на RAG и доводят процесс до результата. Не сценарный бот — цифровой исполнитель на чистом коде. Исходники остаются у вас.
Настраиваем Linux-серверы, поднимаем CI/CD, контейнеры, мониторинг и бэкапы — чтобы инфраструктура работала 24/7, релизы выкатывались в один клик, а вы спали спокойно. DevOps под ключ от студии с 2008 года.
Внедряем нейросети для бизнеса не «вообще», а под конкретные задачи: генерация текстов и изображений, обработка обращений, аналитика и суммаризация документов, помощники сотрудников. Подбираем модель под кейс — YandexGPT, GigaChat или open-source на вашем контуре — встраиваем в рабочие процессы и оставляем вам код и доступы. Без хайпа: считаем эффект до старта.