Компьютерное зрение: сложность не в модели, а в остальном.
Обучить детектор на готовом датасете сегодня умеет многое. Работающая система получается там, где решены другие вопросы: откуда берутся изображения, как размечены данные, что делать с ошибками и куда попадает результат. Этим мы и занимаемся.
Детекция и сегментация
Находим объекты, дефекты и аномалии на изображениях, выделяем области и считаем по ним параметры. Именно так устроен EyeMesearing: сегментация структур глаза и расчёт MRD1, MRD2 по геометрии.
Данные и разметка
Если размеченных данных нет, их сбор - первый этап работы, а не предусловие. Качество разметки определяет потолок системы сильнее, чем архитектура модели.
Порог под цену ошибки
Пропуск и ложное срабатывание стоят по-разному в разных задачах. Порог выбирается под эту цену, а не под красивую цифру в отчёте.
Инференс в реальной системе
Приём изображений, обработка, хранение результатов и вывод туда, где с ними работают. Основная инженерия здесь, а не в обучении.
Какие задачи решает компьютерное зрение?
Практически - четыре: найти объект на изображении, отнести изображение к классу, выделить область и посчитать по ней параметры, заметить аномалию. Прикладные задачи почти всегда сводятся к комбинации этих четырёх.
Сколько данных нужно?
Зависит от того, насколько объекты похожи между собой и насколько разнообразны условия съёмки. Начинать можно с небольшого набора для оценки, чтобы понять потолок, а не собирать сразу большой корпус вслепую.
Можно ли обойтись готовыми моделями?
Иногда да, и это нормальный ответ. Готовые модели хорошо работают на распространённых объектах и плохо - на специфичных для вашей отрасли. Проверяется быстро и дёшево.
Что с ошибками модели?
Их не убрать в ноль. Вопрос ставится иначе: что дороже в вашей задаче - пропустить или дать ложное срабатывание. От ответа зависят и порог, и сценарий проверки человеком.