Написать нам в Telegram

ИИ для документов: как работает распознавание и что даёт бизнесу

Разработка
19 сентября 2026 г.
Фото Максим Козлов
Максим КозловРуководитель отдела разработки

Бухгалтер перебивает в 1С пятисотый за месяц счёт, менеджер копирует реквизиты из скана договора в CRM, кадровик вручную заносит паспортные данные нового сотрудника. Всё это задачи, для которых бизнес ищет ИИ для документов: система сама читает скан или фото, понимает, что это за документ, и вынимает нужные поля в учётную систему. Ниже разберём, как устроено распознавание документов с ИИ, чем отличаются OCR, IDP и нейросети-LLM, как мерить точность и что учесть по 152-ФЗ, прежде чем запускать пилот.

Что такое распознавание документов с ИИ простыми словами

Распознавание документов — это превращение бумаги, скана, фото или PDF-картинки в структурированные данные: не просто «текст страницы», а конкретные значения «номер счёта», «дата», «ИНН продавца», «сумма с НДС», «строки товаров». Раньше это был только OCR (оптическое распознавание символов), сегодня поверх него работают модели, которые определяют тип документа, находят и проверяют поля.

Общие задачи зрения разобраны в статье про компьютерное зрение, здесь — именно документный конвейер: от письма со сканом до проведённого документа в 1С.

Распознавание и ЭДО — разные вещи. ЭДО — это юридически значимый обмен электронными документами с подписью, где данные уже структурированы (XML). Распознавание нужно там, где документ пришёл бумагой, сканом или PDF-картинкой и данные из него надо достать.

OCR, IDP и LLM-извлечение: в чём разница

Под запросом «нейросеть для документов» скрываются три поколения технологий, которые сильно различаются по цене, точности и рискам.

  • OCR превращает изображение в текст: строки и координаты, без понимания, где ИНН, а где сумма.
  • IDP (intelligent document processing, интеллектуальная обработка документов) — платформа, где OCR дополнен классификацией, извлечением полей, правилами проверки и интерфейсом оператора.
  • LLM-извлечение — мультимодальная модель получает изображение или распознанный текст и инструкцию «верни JSON с такими-то полями»; настраивается промптом, без обучения.
КритерийOCRIDP-платформаLLM-извлечение
Что на выходеТекст страницыПоля и таблицы с оценкой уверенностиJSON по заданной схеме
Новый тип документаНе нужен (только текст)Настройка шаблона или обучение моделиПравка промпта и схемы
Сильная сторонаСкорость, дешевизна, работа в контуреПоток типовой первички, контроль, аудитРазнородные документы: договоры, письма, анкеты
Слабое местоНет понимания структурыДорогие лицензии, долгая настройкаМожет «додумать» значение, нестабильный формат
Где крутитсяОблако или свой серверЧаще свой серверОблако или своя GPU-инфраструктура

На практике выигрывает гибрид: OCR снимает текст, модель или LLM извлекает поля, правила и человек проверяют. Крупные IDP-вендоры в 2025–2026 годах добавили в платформы LLM-извлечение.

Главный риск LLM — галлюцинации. Если номер счёта не читается, модель может вернуть правдоподобный номер вместо пустого поля, поэтому без проверок по правилам LLM-извлечение в бухгалтерию не пускают.

Какие документы распознаёт ИИ

Сложность зависит не от «умности» нейросети, а от вариативности документа: чем больше форм и способов заполнения, тем дороже точность.

ДокументыСложностьЧто учесть
Счета, акты, УПД, ТОРГ-12, счета-фактурыСредняяМакеты у каждого поставщика свои, главное — табличная часть на несколько страниц
ТТН, транспортные накладныеСредняя–высокаяМелкий шрифт, штампы и отметки поверх полей, копии плохого качества
Договоры, допсоглашенияВысокаяНужны не поля, а смысл: стороны, срок, сумма, штрафы — это зона LLM
Паспорта, СНИЛС, водительские удостоверенияНизкая по технике, высокая по законуФиксированная форма, но это персональные данные — см. раздел о 152-ФЗ
Кассовые чекиНизкая–средняяТермобумага выцветает; часто проще считать QR-код, чем текст
Анкеты, заявления, рукописноеВысокаяПочерк, зачёркивания, поля «от руки» — самая низкая доля автоматической обработки

Как работает распознавание документов: конвейер из 7 шагов

Любая промышленная система, от коробочной IDP до собственной разработки, повторяет одну и ту же цепочку.

  1. Захват. Сканер, фото со смартфона, почтовый ящик, папка на сервере, личный кабинет или Telegram-бот. Сохраняются оригинал и метаданные: от кого и когда пришло.
  2. Предобработка. Выравнивание перекоса, исправление перспективы, удаление шума, разделение пачки на документы. От этого шага качество зависит сильнее, чем от выбора модели.
  3. Классификация. Счёт, УПД, акт, паспорт или «прочее». Неизвестные документы уходят в отдельную очередь, а не в ближайший похожий класс.
  4. Извлечение полей. Реквизиты, даты, суммы, строки таблиц — с уверенностью модели и местом на изображении, чтобы оператор видел, откуда взято значение.
  5. Валидация. Проверки по правилам и внешним источникам (подробно ниже).
  6. Человек в контуре. Документы с низкой уверенностью или проваленной проверкой уходят оператору, он правит только подсвеченные поля; исправления идут в дообучение.
  7. Выгрузка. Создание документа в 1С, карточки в CRM, записи в реестре, прикрепление скана. Интеграция с 1С и CRM обычно занимает больше времени, чем само распознавание.
Не пытайтесь автоматизировать 100% потока. Цель пилота — чтобы типовые документы проходили без участия человека, а сложные приходили оператору с уже заполненными полями.

Валидация: что проверять автоматически

  • Контрагент. ИНН проходит проверку контрольного числа, затем сверяется с ЕГРЮЛ/ЕГРИП: вручную — через бесплатный сервис ФНС egrul.nalog.ru, автоматически — через API сервисов проверки контрагентов или собственную базу поставщиков. Сверяют название, КПП, статус компании.
  • Арифметика. Сумма строк равна итогу, НДС соответствует ставке и базе (с 1 января 2026 года основная ставка — 22%), количество × цена = сумма строки.
  • Связь с учётом. Есть ли в 1С заказ или договор с этим поставщиком, не заведён ли уже документ с тем же номером и датой (защита от дублей).
  • Формальные признаки. Дата не из будущего, номер в ожидаемом формате, есть подпись и печать там, где они обязательны.

Точность распознавания: как мерить и чему не верить

«Точность 99%» в рекламе ничего не говорит, пока не ясно, что считали. 99% верных символов и 99% верных документов — разные вещи: при сотне символов на документ ошибка в 1% символов даёт в среднем одну ошибку на документ.

МетрикаЧто показываетКак считать
Точность по символам (CER)Качество OCR как таковогоДоля неверно распознанных символов по тексту
Точность по полямСколько значений извлечено верноОтдельно по каждому полю: ИНН, дата, сумма, строки
Точность по документамСколько документов полностью корректныВсе обязательные поля документа верны
Доля сквозной обработки (STP)Сколько документов прошли без человекаДокументы без ручной правки / все документы
Скрытые ошибкиСамое опасное: неверное значение с высокой уверенностьюВыборочная ручная проверка «зелёных» документов

Мерить нужно на своих документах, а не на демо вендора: несколько сотен реальных документов, включая плохие сканы и фото с телефона, с ручным эталоном. Например, Smart Engines заявляет производительность до 600 тысяч страниц в сутки на одном сервере без GPU (данные разработчика) — это про скорость, а не про точность на ваших накладных.

Решения для распознавания документов в России в 2026 году

Рынок делится на готовые сервисы, IDP-платформы, облачные API и open-source. Перечень не рейтинг.

  • 1С:Распознавание первичных документов (1С:РПД). Встроен в программы 1С: распознаёт счета, ТОРГ-12, акты, счета-фактуры, УПД, УКД и кассовые чеки и создаёт документы в базе после проверки пользователем (портал 1С). Работает по пакетам страниц. Для типовой первички в 1С — самый короткий путь.
  • Content AI. Бывший российский бизнес ABBYY, после ухода компании из России в 2022 году работающий под брендом Content AI. ContentCapture — IDP-платформа для потокового ввода (аналог ABBYY FlexiCapture), ContentReader — OCR и работа с PDF (аналог FineReader). В апреле 2025 года в ContentCapture добавили извлечение данных с помощью LLM, в том числе YandexGPT и GigaChat (сайт Content AI).
  • Smart Engines (Smart Document Engine). Распознавание на устройстве или серверах заказчика без передачи данных во внешние сервисы.
  • Directum Ario. Интеллектуальные сервисы Directum: разделение пачки, классификация, извлечение фактов; связан с СЭД Directum RX.
  • Yandex Vision OCR (Yandex AI Studio). Облачный API: модели для страниц текста, таблиц и рукописного текста, шаблоны для паспорта и водительского удостоверения, оплата за изображение или страницу (документация Yandex AI Studio).
  • GigaChat и другие российские LLM. Извлечение данных из договоров и неструктурированных документов по инструкции в JSON; для первички — только в связке с проверками.
  • Open-source. Tesseract, PaddleOCR и docTR распространяются под лицензией Apache 2.0, что допускает коммерческое использование. Основа для своей системы в контуре; качество на русских сканах зависит от предобработки и дообучения.

Если документы уже живут в учётной системе и маршрутах согласования, распознавание — лишь один модуль. Его стоит проектировать вместе с остальной автоматизацией документооборота: реестром, маршрутами, контролем сроков и выгрузкой в 1С.

Как выбрать: готовый сервис, платформа или своя разработка

СитуацияРациональный выбор
Типовая первичка, учёт в 1С, поток умеренный1С:РПД или аналогичный сервис учётной системы
Большой поток разных документов, строгий аудитIDP-платформа в своём контуре
Нестандартные документы: договоры, анкеты, отраслевые формыLLM-извлечение с правилами проверки и оператором
Распознавание — часть вашего продукта или порталаСвоя разработка на облачном API или open-source

Честный критерий: если коробка закрывает 80% ваших документов, берите коробку и дорабатывайте края. Своя разработка оправдана, когда документы нетиповые, нужна глубокая интеграция с CRM и внутренними системами или важно не платить лицензию за каждую страницу на большом потоке.

Нейросеть для документов и 152-ФЗ: паспорта, СНИЛС, анкеты

Как только в потоке появляются паспорта, СНИЛС, анкеты или кадровые документы, распознавание становится обработкой персональных данных.

  • Основание и цель. Нужно основание (договор, согласие, требование закона), а извлекать — только поля, нужные для цели. Если достаточно серии и номера, не храните скан «на всякий случай».
  • Локализация. По ч. 5 ст. 18 152-ФЗ запись, систематизация и хранение персональных данных граждан РФ идут в базах на территории России — это касается и базы распознанных документов, и архива сканов.
  • Зарубежные модели. OpenAI, Anthropic и Google официально не работают с Россией — договора и закрывающих документов не будет. Отправка персональных данных в любой зарубежный сервис — трансграничная передача: по ст. 12 152-ФЗ до её начала оператор обязан уведомить Роскомнадзор и оценить, обеспечивает ли страна получателя защиту данных. Поэтому документы с ПДн обычно распознают российскими облачными сервисами или решениями в своём контуре.
  • Биометрия. Фото в паспорте становится биометрическими персональными данными (ст. 11 152-ФЗ), только если система использует его для установления личности. Сверка лица с документом — отдельный режим с отдельными требованиями.
  • Журналирование. Кто открывал документ и исправлял поля — нужно и для защиты данных, и для разбора ошибок.
Типовая утечка происходит не через систему распознавания, а через «временный» обход: сотрудник загружает пачку паспортов в публичный чат-бот, чтобы быстрее заполнить таблицу. Закрывайте такой сценарий регламентом и нормальным внутренним инструментом.

Что даёт бизнесу ИИ для обработки документов

Эффект измеряется до и после пилота в трёх местах.

  • Время ввода. Сотрудник не набирает, а проверяет подсвеченные поля. Среднее время на документ до и после — главная строка экономики.
  • Ошибки. Опечатки в ИНН, суммах и датах ловят проверки, а не контрагент при сверке.
  • Скорость процесса. Документ попадает в учёт в день поступления, а не в конце месяца: быстрее закрывается период и уходит оплата.

Распознавание часто становится первым шагом к более сложным сценариям: ИИ-агент разбирает входящую почту, находит счёт, проверяет его по заказу и ставит оплату на согласование. Такие проекты делают в рамках внедрения ИИ в процессы компании, а не как отдельную «распознавалку».

Типичные ошибки при внедрении распознавания

  1. Выбор по демо. Вендор показывает идеальные сканы. Реальный поток — фото на коленке и печати поверх суммы.
  2. Нет метрик до старта. Без замера текущего времени на документ и числа ошибок невозможно доказать эффект.
  3. Доверие к «уверенным» полям. Автопроводка без выборочного контроля копит скрытые ошибки, которые всплывают при сверке.
  4. Нет владельца процесса. Кто-то должен разбирать очередь исключений и новые макеты поставщиков.

Чек-лист пилота по распознаванию документов

  • Выбран один поток с понятным объёмом (например, входящие УПД и счета)
  • Замерены документов в месяц, минут на документ, ошибок при сверке
  • Собран тестовый набор с ручным эталоном; выбраны метрики: точность по полям и документам, STP, скрытые ошибки
  • Определены обязательные поля и правила проверки: ИНН, суммы, НДС, дубли, связь с заказом
  • Решено, где обрабатываются данные: облако РФ или свой сервер
  • Спроектирован интерфейс оператора для документов с низкой уверенностью
  • Настроена выгрузка в 1С, CRM или реестр, а не только экспорт в Excel
  • Назначен владелец процесса и порядок работы с новыми макетами документов
  • Заложены критерии успеха и масштабирования
Частые вопросы
Да, для типовой первички в 1С есть сервис 1С:Распознавание первичных документов: он встроен в программы 1С и распознаёт счета, акты, ТОРГ-12, счета-фактуры, УПД, УКД и кассовые чеки. Пользователь загружает сканы, проверяет результат и создаёт документы в базе. Отдельная система нужна, когда документы нетиповые, поток большой или данные надо разносить не только в 1С, но и в CRM и другие системы.
Универсального лидера нет: для первички в 1С рационален встроенный сервис, для большого потока — IDP-платформа, для договоров и анкет — языковая модель с правилами проверки. Выбирать стоит по результату на ваших документах: соберите тестовый набор из нескольких сотен реальных сканов и сравните кандидатов по точности полей и доле документов без ручной правки.
Документы без персональных данных и коммерческой тайны — технически да, но для рабочих процессов это ненадёжно: нет договора, закрывающих документов и гарантий обработки. Паспорта, анкеты и кадровые документы — это персональные данные: их отправка в зарубежный сервис считается трансграничной передачей и по ст. 12 152-ФЗ требует уведомления Роскомнадзора, а при отсутствии договора с сервисом законно выстроить её практически невозможно. Поэтому для таких задач используют российские облака или модели в своём контуре.
Да, но заметно хуже печатного: результат зависит от почерка, качества скана и языка. Для рукописного текста нужны специальные модели — например, у Yandex Vision OCR есть отдельная модель для русского и английского рукописного текста. В анкетах и заявлениях рукописные поля почти всегда требуют проверки оператором, поэтому доля сквозной обработки у них ниже, чем у печатной первички.
Готовые сервисы вроде 1С:РПД оплачиваются пакетами страниц. Заказная разработка зависит от числа типов документов, проверок и интеграций: отдельный блок автоматизации документооборота стоит от 80 000 ₽ и занимает 2–4 недели, пилот внедрения ИИ по одной задаче — от 200 000 ₽. Для решений на LLM добавляется ежемесячный расход на токены и поддержку.
Для LLM-извлечения часто достаточно инструкции и схемы полей: модель работает без обучения, её поведение настраивают промптом и примерами. Классические IDP-модели для нестандартных форм требуют разметки десятков или сотен образцов. В любом случае нужен размеченный тестовый набор — без него невозможно измерить точность и понять, стало ли лучше после изменений.
Автоматизация документооборота
Поможем с этой задачей под ключ — от идеи до результата. Рассчитаем стоимость и сроки под вашу задачу.
Читать подробнее
Услуги по теме
Договоры и счета собираются из шаблонов за секунды, согласование идёт по заданному маршруту, а не пинками по кабинетам, документы подписываются электронно и сами ложатся в реестр. Автоматизация документооборота под ключ на ReactJS и своей CMS — студия из Санкт-Петербурга с 2008 года.
Внедряем искусственный интеллект в бизнес под ключ: начинаем с диагностики ваших процессов, отбираем задачи с понятным эффектом, подбираем модель (GPT, YandexGPT, GigaChat), собираем RAG по вашей базе знаний и интеграции, проходим путь пилот → продакшн с замером ROI. Не «коробка с ИИ», а инженерное решение на вашем коде — исходники остаются у вас.
Двусторонняя интеграция сайта с 1С и CRM под ключ: товары, остатки, цены и заказы синхронизируются автоматически, без ручного переноса. CommerceML и REST API, amoCRM и Битрикс24 — студия с 2008 года.
Внедряем нейросети для бизнеса не «вообще», а под конкретные задачи: генерация текстов и изображений, обработка обращений, аналитика и суммаризация документов, помощники сотрудников. Подбираем модель под кейс — YandexGPT, GigaChat или open-source на вашем контуре — встраиваем в рабочие процессы и оставляем вам код и доступы. Без хайпа: считаем эффект до старта.