ИИ для документов: как работает распознавание и что даёт бизнесу
Бухгалтер перебивает в 1С пятисотый за месяц счёт, менеджер копирует реквизиты из скана договора в CRM, кадровик вручную заносит паспортные данные нового сотрудника. Всё это задачи, для которых бизнес ищет ИИ для документов: система сама читает скан или фото, понимает, что это за документ, и вынимает нужные поля в учётную систему. Ниже разберём, как устроено распознавание документов с ИИ, чем отличаются OCR, IDP и нейросети-LLM, как мерить точность и что учесть по 152-ФЗ, прежде чем запускать пилот.
Что такое распознавание документов с ИИ простыми словами
Распознавание документов — это превращение бумаги, скана, фото или PDF-картинки в структурированные данные: не просто «текст страницы», а конкретные значения «номер счёта», «дата», «ИНН продавца», «сумма с НДС», «строки товаров». Раньше это был только OCR (оптическое распознавание символов), сегодня поверх него работают модели, которые определяют тип документа, находят и проверяют поля.
Общие задачи зрения разобраны в статье про компьютерное зрение, здесь — именно документный конвейер: от письма со сканом до проведённого документа в 1С.
OCR, IDP и LLM-извлечение: в чём разница
Под запросом «нейросеть для документов» скрываются три поколения технологий, которые сильно различаются по цене, точности и рискам.
- OCR превращает изображение в текст: строки и координаты, без понимания, где ИНН, а где сумма.
- IDP (intelligent document processing, интеллектуальная обработка документов) — платформа, где OCR дополнен классификацией, извлечением полей, правилами проверки и интерфейсом оператора.
- LLM-извлечение — мультимодальная модель получает изображение или распознанный текст и инструкцию «верни JSON с такими-то полями»; настраивается промптом, без обучения.
| Критерий | OCR | IDP-платформа | LLM-извлечение |
|---|---|---|---|
| Что на выходе | Текст страницы | Поля и таблицы с оценкой уверенности | JSON по заданной схеме |
| Новый тип документа | Не нужен (только текст) | Настройка шаблона или обучение модели | Правка промпта и схемы |
| Сильная сторона | Скорость, дешевизна, работа в контуре | Поток типовой первички, контроль, аудит | Разнородные документы: договоры, письма, анкеты |
| Слабое место | Нет понимания структуры | Дорогие лицензии, долгая настройка | Может «додумать» значение, нестабильный формат |
| Где крутится | Облако или свой сервер | Чаще свой сервер | Облако или своя GPU-инфраструктура |
На практике выигрывает гибрид: OCR снимает текст, модель или LLM извлекает поля, правила и человек проверяют. Крупные IDP-вендоры в 2025–2026 годах добавили в платформы LLM-извлечение.
Какие документы распознаёт ИИ
Сложность зависит не от «умности» нейросети, а от вариативности документа: чем больше форм и способов заполнения, тем дороже точность.
| Документы | Сложность | Что учесть |
|---|---|---|
| Счета, акты, УПД, ТОРГ-12, счета-фактуры | Средняя | Макеты у каждого поставщика свои, главное — табличная часть на несколько страниц |
| ТТН, транспортные накладные | Средняя–высокая | Мелкий шрифт, штампы и отметки поверх полей, копии плохого качества |
| Договоры, допсоглашения | Высокая | Нужны не поля, а смысл: стороны, срок, сумма, штрафы — это зона LLM |
| Паспорта, СНИЛС, водительские удостоверения | Низкая по технике, высокая по закону | Фиксированная форма, но это персональные данные — см. раздел о 152-ФЗ |
| Кассовые чеки | Низкая–средняя | Термобумага выцветает; часто проще считать QR-код, чем текст |
| Анкеты, заявления, рукописное | Высокая | Почерк, зачёркивания, поля «от руки» — самая низкая доля автоматической обработки |
Как работает распознавание документов: конвейер из 7 шагов
Любая промышленная система, от коробочной IDP до собственной разработки, повторяет одну и ту же цепочку.
- Захват. Сканер, фото со смартфона, почтовый ящик, папка на сервере, личный кабинет или Telegram-бот. Сохраняются оригинал и метаданные: от кого и когда пришло.
- Предобработка. Выравнивание перекоса, исправление перспективы, удаление шума, разделение пачки на документы. От этого шага качество зависит сильнее, чем от выбора модели.
- Классификация. Счёт, УПД, акт, паспорт или «прочее». Неизвестные документы уходят в отдельную очередь, а не в ближайший похожий класс.
- Извлечение полей. Реквизиты, даты, суммы, строки таблиц — с уверенностью модели и местом на изображении, чтобы оператор видел, откуда взято значение.
- Валидация. Проверки по правилам и внешним источникам (подробно ниже).
- Человек в контуре. Документы с низкой уверенностью или проваленной проверкой уходят оператору, он правит только подсвеченные поля; исправления идут в дообучение.
- Выгрузка. Создание документа в 1С, карточки в CRM, записи в реестре, прикрепление скана. Интеграция с 1С и CRM обычно занимает больше времени, чем само распознавание.
Валидация: что проверять автоматически
- Контрагент. ИНН проходит проверку контрольного числа, затем сверяется с ЕГРЮЛ/ЕГРИП: вручную — через бесплатный сервис ФНС egrul.nalog.ru, автоматически — через API сервисов проверки контрагентов или собственную базу поставщиков. Сверяют название, КПП, статус компании.
- Арифметика. Сумма строк равна итогу, НДС соответствует ставке и базе (с 1 января 2026 года основная ставка — 22%), количество × цена = сумма строки.
- Связь с учётом. Есть ли в 1С заказ или договор с этим поставщиком, не заведён ли уже документ с тем же номером и датой (защита от дублей).
- Формальные признаки. Дата не из будущего, номер в ожидаемом формате, есть подпись и печать там, где они обязательны.
Точность распознавания: как мерить и чему не верить
«Точность 99%» в рекламе ничего не говорит, пока не ясно, что считали. 99% верных символов и 99% верных документов — разные вещи: при сотне символов на документ ошибка в 1% символов даёт в среднем одну ошибку на документ.
| Метрика | Что показывает | Как считать |
|---|---|---|
| Точность по символам (CER) | Качество OCR как такового | Доля неверно распознанных символов по тексту |
| Точность по полям | Сколько значений извлечено верно | Отдельно по каждому полю: ИНН, дата, сумма, строки |
| Точность по документам | Сколько документов полностью корректны | Все обязательные поля документа верны |
| Доля сквозной обработки (STP) | Сколько документов прошли без человека | Документы без ручной правки / все документы |
| Скрытые ошибки | Самое опасное: неверное значение с высокой уверенностью | Выборочная ручная проверка «зелёных» документов |
Мерить нужно на своих документах, а не на демо вендора: несколько сотен реальных документов, включая плохие сканы и фото с телефона, с ручным эталоном. Например, Smart Engines заявляет производительность до 600 тысяч страниц в сутки на одном сервере без GPU (данные разработчика) — это про скорость, а не про точность на ваших накладных.
Решения для распознавания документов в России в 2026 году
Рынок делится на готовые сервисы, IDP-платформы, облачные API и open-source. Перечень не рейтинг.
- 1С:Распознавание первичных документов (1С:РПД). Встроен в программы 1С: распознаёт счета, ТОРГ-12, акты, счета-фактуры, УПД, УКД и кассовые чеки и создаёт документы в базе после проверки пользователем (портал 1С). Работает по пакетам страниц. Для типовой первички в 1С — самый короткий путь.
- Content AI. Бывший российский бизнес ABBYY, после ухода компании из России в 2022 году работающий под брендом Content AI. ContentCapture — IDP-платформа для потокового ввода (аналог ABBYY FlexiCapture), ContentReader — OCR и работа с PDF (аналог FineReader). В апреле 2025 года в ContentCapture добавили извлечение данных с помощью LLM, в том числе YandexGPT и GigaChat (сайт Content AI).
- Smart Engines (Smart Document Engine). Распознавание на устройстве или серверах заказчика без передачи данных во внешние сервисы.
- Directum Ario. Интеллектуальные сервисы Directum: разделение пачки, классификация, извлечение фактов; связан с СЭД Directum RX.
- Yandex Vision OCR (Yandex AI Studio). Облачный API: модели для страниц текста, таблиц и рукописного текста, шаблоны для паспорта и водительского удостоверения, оплата за изображение или страницу (документация Yandex AI Studio).
- GigaChat и другие российские LLM. Извлечение данных из договоров и неструктурированных документов по инструкции в JSON; для первички — только в связке с проверками.
- Open-source. Tesseract, PaddleOCR и docTR распространяются под лицензией Apache 2.0, что допускает коммерческое использование. Основа для своей системы в контуре; качество на русских сканах зависит от предобработки и дообучения.
Если документы уже живут в учётной системе и маршрутах согласования, распознавание — лишь один модуль. Его стоит проектировать вместе с остальной автоматизацией документооборота: реестром, маршрутами, контролем сроков и выгрузкой в 1С.
Как выбрать: готовый сервис, платформа или своя разработка
| Ситуация | Рациональный выбор |
|---|---|
| Типовая первичка, учёт в 1С, поток умеренный | 1С:РПД или аналогичный сервис учётной системы |
| Большой поток разных документов, строгий аудит | IDP-платформа в своём контуре |
| Нестандартные документы: договоры, анкеты, отраслевые формы | LLM-извлечение с правилами проверки и оператором |
| Распознавание — часть вашего продукта или портала | Своя разработка на облачном API или open-source |
Честный критерий: если коробка закрывает 80% ваших документов, берите коробку и дорабатывайте края. Своя разработка оправдана, когда документы нетиповые, нужна глубокая интеграция с CRM и внутренними системами или важно не платить лицензию за каждую страницу на большом потоке.
Нейросеть для документов и 152-ФЗ: паспорта, СНИЛС, анкеты
Как только в потоке появляются паспорта, СНИЛС, анкеты или кадровые документы, распознавание становится обработкой персональных данных.
- Основание и цель. Нужно основание (договор, согласие, требование закона), а извлекать — только поля, нужные для цели. Если достаточно серии и номера, не храните скан «на всякий случай».
- Локализация. По ч. 5 ст. 18 152-ФЗ запись, систематизация и хранение персональных данных граждан РФ идут в базах на территории России — это касается и базы распознанных документов, и архива сканов.
- Зарубежные модели. OpenAI, Anthropic и Google официально не работают с Россией — договора и закрывающих документов не будет. Отправка персональных данных в любой зарубежный сервис — трансграничная передача: по ст. 12 152-ФЗ до её начала оператор обязан уведомить Роскомнадзор и оценить, обеспечивает ли страна получателя защиту данных. Поэтому документы с ПДн обычно распознают российскими облачными сервисами или решениями в своём контуре.
- Биометрия. Фото в паспорте становится биометрическими персональными данными (ст. 11 152-ФЗ), только если система использует его для установления личности. Сверка лица с документом — отдельный режим с отдельными требованиями.
- Журналирование. Кто открывал документ и исправлял поля — нужно и для защиты данных, и для разбора ошибок.
Что даёт бизнесу ИИ для обработки документов
Эффект измеряется до и после пилота в трёх местах.
- Время ввода. Сотрудник не набирает, а проверяет подсвеченные поля. Среднее время на документ до и после — главная строка экономики.
- Ошибки. Опечатки в ИНН, суммах и датах ловят проверки, а не контрагент при сверке.
- Скорость процесса. Документ попадает в учёт в день поступления, а не в конце месяца: быстрее закрывается период и уходит оплата.
Распознавание часто становится первым шагом к более сложным сценариям: ИИ-агент разбирает входящую почту, находит счёт, проверяет его по заказу и ставит оплату на согласование. Такие проекты делают в рамках внедрения ИИ в процессы компании, а не как отдельную «распознавалку».
Типичные ошибки при внедрении распознавания
- Выбор по демо. Вендор показывает идеальные сканы. Реальный поток — фото на коленке и печати поверх суммы.
- Нет метрик до старта. Без замера текущего времени на документ и числа ошибок невозможно доказать эффект.
- Доверие к «уверенным» полям. Автопроводка без выборочного контроля копит скрытые ошибки, которые всплывают при сверке.
- Нет владельца процесса. Кто-то должен разбирать очередь исключений и новые макеты поставщиков.
Чек-лист пилота по распознаванию документов
- Выбран один поток с понятным объёмом (например, входящие УПД и счета)
- Замерены документов в месяц, минут на документ, ошибок при сверке
- Собран тестовый набор с ручным эталоном; выбраны метрики: точность по полям и документам, STP, скрытые ошибки
- Определены обязательные поля и правила проверки: ИНН, суммы, НДС, дубли, связь с заказом
- Решено, где обрабатываются данные: облако РФ или свой сервер
- Спроектирован интерфейс оператора для документов с низкой уверенностью
- Настроена выгрузка в 1С, CRM или реестр, а не только экспорт в Excel
- Назначен владелец процесса и порядок работы с новыми макетами документов
- Заложены критерии успеха и масштабирования
