Написать нам в Telegram

Компьютерное зрение: что это и где применяется в бизнесе

Разработка
19 сентября 2026 г.
Фото Максим Козлов
Максим КозловРуководитель отдела разработки

Компьютерное зрение — это направление искусственного интеллекта, в котором программа получает изображение или видео и извлекает из него структурированную информацию: что за объект в кадре, где он находится, сколько их, соответствует ли он норме, какой текст на нём написан. Для бизнеса это способ превратить камеру или скан в источник данных: брак на конвейере, пустая полка, рабочий без каски, поля счёта становятся записью в системе, а не картинкой, которую разглядывает человек.

Что такое компьютерное зрение простыми словами

Человек видит на фото «12 коробок, одна помята», компьютер — массив чисел: яркость и цвет пикселей. Компьютерное зрение (computer vision, CV) — методы, которые переводят эти числа в смысл: класс объекта, его координаты, контур, текст, движение между кадрами.

Система состоит из трёх частей: источник изображения (IP- или промышленная камера, смартфон, сканер), модель, анализирующая кадр, и бизнес-логика, которая решает, что делать с результатом: отбраковать деталь, отправить уведомление, записать поля документа в 1С.

Компьютерное зрение не «смотрит» как человек. Оно хорошо решает узкую, чётко сформулированную задачу на тех условиях съёмки, на которых обучено, и плохо — всё, что за их пределами.

Компьютерное или машинное зрение: есть ли разница

Термины часто используют как синонимы. В промышленности «машинным зрением» называют связку «камера + свет + контроллер» на линии: измерение размеров, чтение маркировки, контроль сборки, иногда без нейросетей. «Компьютерное зрение» шире: это и научная область, и модели для любых изображений — от видео с парковки до фото накладной.

Задачи компьютерного зрения: что оно умеет

Почти любой бизнес-кейс сводится к одной или нескольким базовым задачам. От того, какая это задача, зависят объём разметки, модель и стоимость.

ЗадачаЧто делаетПример в бизнесе
КлассификацияОтносит весь кадр к одному классуГодная деталь / брак; тип товара на фото от покупателя
ДетекцияНаходит объекты и рисует вокруг них рамкиПодсчёт коробок на паллете, людей в очереди, техники на площадке
СегментацияВыделяет точный контур объекта по пикселямПлощадь дефекта на металле, границы поля на снимке с дрона
ТрекингОтслеживает объект между кадрами видеоВремя ожидания в очереди, маршрут погрузчика по складу
OCR (распознавание текста)Извлекает текст и поля из изображенияСчета, накладные, паспорта, этикетки, госномера
Распознавание лицСравнивает лицо с эталоном или базойПроход по лицу, подтверждение личности — с жёсткими правовыми ограничениями

Отдельно выделяют оценку позы, поиск аномалий (когда брака мало и его нельзя заранее описать) и 3D-реконструкцию.

Как работает компьютерное зрение: нейросети, YOLO и мультимодальные LLM

Классический конвейер и свёрточные сети

До 2012 года алгоритмы строились на ручных признаках: границы, углы, гистограммы цветов. Их до сих пор применяют в OpenCV для простых задач — измерить размер, найти контур на контрастном фоне. Прорыв произошёл со свёрточными нейросетями (CNN): они сами учатся выделять признаки на размеченных примерах — от линий на первых слоях до «формы бутылки» на глубоких.

Трансформеры и YOLO

С 2020-х в CV пришли визуальные трансформеры (ViT): изображение режется на фрагменты, и модель учитывает связи между ними, как языковая — связи слов. В детекции чаще всего используют семейство YOLO («смотришь один раз»): модель за один проход выдаёт все объекты с рамками и работает в реальном времени даже на недорогом железе.

Мультимодальные LLM: где их хватает, а где нужна своя модель

Современные большие языковые модели принимают на вход картинку: можно отправить фото накладной и попросить вернуть поля в JSON, или фото витрины — и спросить, чего не хватает. Датасет собирать и модель обучать не нужно.

КритерийМультимодальная LLMСвоя модель (YOLO, CNN)
СтартДни: промпт + проверка на выборкеНедели: сбор и разметка данных, обучение
Подходит дляДокументы, разовый разбор фото, нестандартные вопросы к картинкеПоток видео, конвейер, подсчёт, мелкие дефекты
СкоростьСекунды на кадрМиллисекунды на кадр
Стоимость на объёмеРастёт с каждым изображениемПочти фиксированная после обучения
Точность на узкой задачеХорошая «в среднем», промахи на редких случаяхВысокая на своих условиях съёмки
Практическое правило: если кадров десятки-сотни в день и задача «прочитать и понять» — начните с мультимодальной LLM. Если это видеопоток или тысячи изделий в час — нужна своя обученная модель.

Применение компьютерного зрения в бизнесе: отрасли и примеры

Производство: контроль качества и брак

Самая зрелая область: камеры над линией находят царапины и сколы, проверяют комплектность сборки и маркировку. Показательный пример — «Северсталь»: по данным компании, на Череповецком меткомбинате системы инспекции поверхности распознают от 40 до 100 классов дефектов на цветных изображениях и под каждый тип металла используют свою модель (Computerworld Россия). Цифровая система аттестации, частью которой являются эти решения, охватывает 35 агрегатов и около 60% товарной продукции, а инвестиции за 10 лет составили порядка 2 млрд ₽ («Управление производством»).

Склад и ритейл: выкладка, подсчёт, очереди

Контроль выкладки и пустых полок, подсчёт товара на паллетах и в ячейках, чтение этикеток с фото, длина очереди на кассах, подсчёт посетителей. Обычно хватает детекции и трекинга на существующих камерах, если позволяет угол обзора.

Стройка и охрана труда

Контроль касок, жилетов и страховочных привязей, вход в опасную зону, работа техники рядом с людьми. Критичны ракурс и освещение; без калибровки под объект и ручной проверки тревог поток ложных срабатываний быстро приучает их игнорировать.

Документы: OCR счетов, накладных, паспортов

Для офисного бизнеса это обычно самый быстрый путь к окупаемости. Шаблонные документы (паспорт, водительское удостоверение) читают готовые облачные сервисы, произвольные счета и акты удобнее разбирать мультимодальной LLM с проверкой по справочникам. Как это встраивается в учёт — тема автоматизации документооборота.

Автотранспорт, агро, медицина

Распознавание госномеров на въезде — массовое коробочное решение. В агро компьютерное зрение считает растения на снимках с дронов, находит болезни по листьям, сортирует продукцию. В медицине модели анализируют рентген, КТ и маммографию, но программное обеспечение для диагностики, в том числе с ИИ, в России — медицинское изделие и подлежит регистрации в Росздравнадзоре: это отдельный регуляторный путь, а не типовой ИТ-проект.

Данные и разметка: сколько нужно фото и что влияет на точность

Качество модели в первую очередь определяют данные. Типовые вопросы первых недель проекта:

  • Объём. Для дообучения готовой детекционной модели обычно нужны сотни размеченных изображений на класс; редкие дефекты собирают месяцами или дополняют синтетикой. Точную цифру показывает только пилот.
  • Разметка. Рамки, контуры или подписи расставляют вручную в инструментах вроде CVAT или Label Studio. Важнее скорости — единые правила: что считается дефектом, как размечать частично видимый объект.
  • Разнообразие. День и ночь, смены, сезоны, грязная линза: модель, обученная на летних кадрах, может «ослепнуть» в декабре.
  • Камеры и свет. Разрешения камеры видеонаблюдения часто не хватает для мелких дефектов; на производстве свет и крепление проектируют так же тщательно, как модель.
Частая ловушка — обучить модель на «красивых» фото, снятых специально для проекта, а запустить на реальных камерах. Собирайте датасет с тех же камер, с того же ракурса и в тех же условиях, где система будет работать.

Edge или облако

Edge — обработка у камеры: на мини-ПК с GPU, специализированном модуле или умной камере. Работает без интернета, задержка в миллисекундах, видео не уходит за периметр. Облако проще масштабировать, но нужен стабильный канал, а потоковое видео обходится дорого. Для конвейера и видеоаналитики обычно выбирают edge, для документов — облако или сервер компании.

Распознавание лиц и закон: биометрия, 152-ФЗ, 572-ФЗ, ТК РФ

Технически простой проект здесь может обойтись в штрафы. Ключевые нормы:

  • Статья 11 152-ФЗ. Изображение лица, используемое для установления личности, — биометрические персональные данные. Их обработка по общему правилу допускается только с письменного согласия. Видео с камеры само по себе биометрией не является, пока система не устанавливает личность.
  • 572-ФЗ и ЕБС. Идентификация по лицу и голосу («кто это» — поиск по базе 1:N) по общему правилу допускается только через государственную Единую биометрическую систему. Аутентификация («тот ли это человек» — сверка 1:1) — через ЕБС или аккредитованную систему, взаимодействующую с ЕБС. Хранить у себя биометрические образцы для этих целей организация не вправе (кроме краткого срока для разбора обращений), а принуждать к сдаче биометрии запрещено (разбор 572-ФЗ, актуальный на июль 2026).
  • Штрафы. За обработку биометрии без согласия — до 700 тыс. ₽ для юрлица, за утечку биометрических данных — 15–20 млн ₽ (ст. 13.11 КоАП РФ в редакции 420-ФЗ).
  • Видеонаблюдение за сотрудниками. Камеры на рабочих местах должны быть открытыми и закреплены в локальном акте, с которым работников знакомят под подпись; если наблюдение вводится для уже работающих сотрудников как изменение организационных условий труда, действует порядок ст. 74 ТК РФ — уведомление не позднее чем за два месяца. Обработка и передача изображений сотрудников — по правилам ст. 86 и 88 ТК РФ.

Если задачу можно решить без установления личности, решайте без неё: подсчёт людей, контроль касок, время в очереди работают на обезличенной детекции и не требуют биометрического режима.

Инструменты: российские облака и open-source

Облачные API. Yandex Vision OCR распознаёт текст и шаблонные документы (паспорт, водительское удостоверение, СТС) с оплатой за каждое изображение или страницу (документация Yandex AI Studio). В VK Cloud есть сервис Vision для распознавания объектов, сцен, лиц и госномеров через API (документация VK Cloud). Cloud.ru (бывший SberCloud) даёт GPU и ML-платформу для обучения своих моделей. Под нестандартные дефекты или свою продукцию модель всё равно придётся обучать.

Open-source. OpenCV — базовая библиотека обработки изображений, с версии 4.5.0 под лицензией Apache 2.0, её можно использовать в коммерческих продуктах. Ultralytics YOLO — самый популярный фреймворк для детекции, но с юридическим нюансом.

Ultralytics YOLO распространяется под AGPL-3.0. По позиции правообладателя, использование кода или обученных на нём моделей в закрытом проекте — даже внутри компании и даже при обучении с нуля — требует либо открыть исходный код всего проекта, либо купить Enterprise License (ultralytics.com/license). Проверьте лицензию до старта.

Альтернативы с разрешительными лицензиями есть — например, модели детекции из torchvision (BSD) и DETR (Apache 2.0); лицензию конкретных весов всё равно проверяйте отдельно.

Сколько стоит и сколько длится пилот компьютерного зрения

Бюджет зависит от готовности данных, железа (камеры, свет, edge-устройства), глубины интеграций (1С, WMS, MES) и требований к точности. Ориентир по проектам внедрения ИИ под ключ: пилот по одной задаче — от 200 000 ₽ и 3–4 недели, вывод в продакшн с интеграциями — от 500 000 ₽ и 5–8 недель. Если хватает готовой нейросети без обучения своей модели (например, для разбора документов), ориентир — один сценарий нейросетей для бизнеса под ключ: от 150 000 ₽ и 2–4 недели. Оборудование считается отдельно, итоговая смета зависит от объёма данных и интеграций.

Пилот должен закончиться цифрами: полнота (доля найденного брака), доля ложных тревог, время обработки, экономия человеко-часов. Как отбирать задачи под пилот — в статье «Нейросети для бизнеса: с чего начать».

Типичные ошибки при внедрении компьютерного зрения

  1. Нечёткая постановка. «Хотим видеть брак» вместо «находить сколы от 2 мм на торце детали при скорости линии 1 м/с».
  2. Смена съёмки после разметки. Поменяли камеру или ракурс — датасет частично обесценился.
  3. Одна метрика «точность 98%». При браке в 1% модель, которая всегда говорит «годно», тоже точна на 99%. Смотрите полноту и ложные срабатывания отдельно.
  4. Нет петли дообучения. Меняются продукция, упаковка, сезон — без сбора ошибок и переобучения качество падает.
  5. Результат не встроен в процесс. Брак найден, но сигнал никуда не идёт: ни остановки линии, ни записи в MES.

Чек-лист перед запуском проекта компьютерного зрения

  • Задача сформулирована как одна из базовых: классификация, детекция, сегментация, трекинг, OCR
  • Определены метрики: полнота, доля ложных тревог, скорость, экономия времени
  • Проверено, не закрывает ли задачу мультимодальная LLM или готовый облачный API
  • Собраны реальные кадры с рабочих камер во всех условиях съёмки, утверждены правила разметки
  • Выбрано место обработки: edge, облако или свой сервер
  • Проверены лицензии моделей и библиотек под коммерческое использование
  • Если есть лица — пройден юридический разбор по 152-ФЗ, 572-ФЗ и ТК РФ; если можно без них — работаем обезличенно
  • Продумано, куда уходит результат: 1С, WMS, MES, уведомления ответственным
  • Заложен процесс сбора ошибок и дообучения модели после запуска

Вывод

Компьютерное зрение — зрелая технология с измеримым эффектом, но результат даёт не «камера с ИИ», а связка: точная постановка, данные с реальных камер, выбор между готовой нейросетью и своей моделью, проверка лицензий и закона, встраивание в процесс. Начинайте с одной задачи, где визуальный контроль делают люди и ошибка стоит денег, и доказывайте эффект пилотом.

Частые вопросы
Разблокировка смартфона по лицу, распознавание текста на фото в камере телефона, чтение госномеров на въезде в паркинг, кассы самообслуживания с распознаванием товаров, фильтры в видеозвонках. В бизнесе — контроль брака на линии, подсчёт товара на складе, разбор сканов счетов и накладных.
Да, компьютерное зрение — одно из направлений искусственного интеллекта наряду с обработкой естественного языка и предиктивной аналитикой. Современные системы CV почти всегда построены на машинном обучении: нейросети учатся на размеченных примерах, а не работают по жёстко прописанным правилам.
Машинное обучение — общий метод, при котором модель учится на данных: текстах, таблицах, изображениях. Компьютерное зрение — прикладная область, где этот метод применяют к фото и видео. Большинство задач CV решается средствами машинного обучения, но не всякое машинное обучение связано со зрением.
Часто да — для подсчёта людей, контроля касок, очередей, распознавания номеров. Ограничения: разрешение, ракурс и освещение. Для мелких дефектов на производстве обычно нужны промышленные камеры и продуманный свет. Проверяется это на первых неделях пилота по реальным записям.
Основной — Python: на нём написаны PyTorch, OpenCV-обвязки, фреймворки для обучения и разметки. Для быстрой работы на edge-устройствах модели экспортируют в оптимизированные форматы (ONNX, TensorRT, OpenVINO) и запускают из C++ или Python. Интеграцию с учётными системами можно писать на любом стеке.
Точность зависит от задачи и условий съёмки, а не от технологии «вообще». На узкой задаче со стабильной съёмкой модели находят дефекты лучше уставшего контролёра, на хаотичной съёмке ошибаются чаще. Оценивайте две метрики отдельно — долю найденных случаев и долю ложных тревог — на ваших данных в пилоте.
Внедрение искусственного интеллекта
Поможем с этой задачей под ключ — от идеи до результата. Рассчитаем стоимость и сроки под вашу задачу.
Читать подробнее
Услуги по теме
Внедряем искусственный интеллект в бизнес под ключ: начинаем с диагностики ваших процессов, отбираем задачи с понятным эффектом, подбираем модель (GPT, YandexGPT, GigaChat), собираем RAG по вашей базе знаний и интеграции, проходим путь пилот → продакшн с замером ROI. Не «коробка с ИИ», а инженерное решение на вашем коде — исходники остаются у вас.
Внедряем нейросети для бизнеса не «вообще», а под конкретные задачи: генерация текстов и изображений, обработка обращений, аналитика и суммаризация документов, помощники сотрудников. Подбираем модель под кейс — YandexGPT, GigaChat или open-source на вашем контуре — встраиваем в рабочие процессы и оставляем вам код и доступы. Без хайпа: считаем эффект до старта.
Договоры и счета собираются из шаблонов за секунды, согласование идёт по заданному маршруту, а не пинками по кабинетам, документы подписываются электронно и сами ложатся в реестр. Автоматизация документооборота под ключ на ReactJS и своей CMS — студия из Санкт-Петербурга с 2008 года.
Связываем ваш сайт с 1С, CRM, эквайрингом и доставкой в один отлаженный механизм. REST API, вебхуки, надёжный обмен данными — системная интеграция под ключ от студии с 2008 года.