Научная статья школьника 9 класса о компьютерном зрении в робототехнических системах. В ней есть аннотация, ключевые слова, введение, материалы и методы, результаты, обсуждение и выводы. Сравниваются камеры, стереокамеры, RGB-D-камеры и лидары, классические алгоритмы OpenCV и свёрточные нейросети AlexNet, ResNet и YOLO. Есть таблица датчиков и график ошибки распознавания в конкурсе ImageNet.
Так выглядят листы открытой части в оформлении по ГОСТ. Любой лист можно открыть крупно.
Системы технического зрения стали доступными, и школьники могут использовать камеры и открытые библиотеки в собственных робототехнических проектах.
Какие методы компьютерного зрения применяются в современных роботах и какие из них реально использовать в школьном проекте?
Проанализировать способы применения компьютерного зрения в робототехнических системах и оценить их доступность для школьных проектов.
Робототехнические системы с техническим зрением.
Датчики и методы компьютерного зрения.
3 раздела · 3 подпункта · ≈ 9 стр.
По плану видно, как тема разложена на разделы и сколько места отведено каждому из них. Пункты, которые есть в открытом тексте, ведут прямо к нужному месту.
Объём пунктов указан примерно и посчитан для оформления по ГОСТ 7.32-2017, то есть для шрифта Times New Roman 14 с интервалом 1,5.
Ниже открыто ≈ 4,5 стр. из 10, это введение и первая глава. Заключение и список источников остаются в полной версии.
Аннотация. В статье рассматривается применение компьютерного зрения в робототехнических системах: от промышленных манипуляторов и складских роботов до беспилотных автомобилей и учебных роботов. Описаны основные виды датчиков технического зрения и их сравнительные характеристики, классические методы обработки изображений и методы на основе свёрточных нейронных сетей. На материале результатов международного конкурса ImageNet показано, как за пять лет снизилась ошибка распознавания изображений, и обсуждается, какие из рассмотренных подходов доступны для школьных робототехнических проектов.
Ключевые слова: компьютерное зрение, робототехника, техническое зрение, распознавание образов, свёрточная нейронная сеть, OpenCV, лидар.
Человек получает через зрение большую часть сведений об окружающем мире, и неудивительно, что инженеры давно стремятся дать такую же возможность роботам. Робот, который не видит, способен только повторять заранее записанные движения: промышленный манипулятор на конвейере берёт деталь из одной и той же точки, и если деталь сдвинется на сантиметр, захват промахнётся. Робот, оснащённый камерой и программой анализа изображений, может сам найти деталь, определить её положение и даже отличить годную от бракованной.
Область науки, которая занимается извлечением информации из изображений и видео, называется компьютерным зрением. Её начало обычно относят к 1960-м годам, когда в Массачусетском технологическом институте пытались научить компьютер распознавать на фотографиях простые геометрические тела. Долгое время успехи были скромными, но в последние полтора десятилетия благодаря росту вычислительных мощностей и развитию нейронных сетей компьютерное зрение стало одной из самых быстро развивающихся технологий.
Актуальность темы связана с тем, что системы технического зрения из дорогих лабораторных установок превратились в доступные устройства. Камера, способная работать с роботом, сегодня стоит меньше школьного учебника, а бесплатные библиотеки программ позволяют девятикласснику собрать робота, который следует за мячом определённого цвета или распознаёт дорожные знаки на игрушечной трассе.
Цель работы — проанализировать способы применения компьютерного зрения в робототехнических системах и оценить, какие из них доступны для использования в школьных проектах. Задачи: рассмотреть виды датчиков технического зрения; сравнить классические методы обработки изображений и методы на основе нейронных сетей; проследить, как изменялась точность распознавания изображений; привести примеры использования компьютерного зрения в современных роботах.
Работа выполнена методом анализа научной и учебной литературы, технической документации открытых библиотек и опубликованных результатов соревнований по распознаванию изображений. В качестве основных источников использованы учебники Д. Форсайта и Ж. Понса, Л. Шапиро и Дж. Стокмана, статьи, в которых были впервые описаны нейросетевые модели AlexNet и YOLO, а также итоговый обзор конкурса ImageNet Large Scale Visual Recognition Challenge, опубликованный его организаторами в 2015 году.
Для сравнения датчиков технического зрения были выбраны признаки, важные для робота: какую информацию даёт датчик, может ли он измерять расстояние до предметов, как работает при разном освещении и насколько он доступен по цене. Для сравнения методов обработки изображений учитывались требования к вычислительной мощности, необходимость обучения на больших наборах данных и устойчивость к изменению условий съёмки.
Самый простой и распространённый датчик — обычная цифровая видеокамера. Она даёт цветное изображение, по которому можно распознать предметы, прочитать надписи и определить цвет, но сама по себе не измеряет расстояние. Чтобы робот видел глубину, используют стереокамеры, которые, как глаза человека, снимают сцену с двух точек и вычисляют расстояние по смещению изображений, а также камеры глубины, или RGB-D-камеры. Одной из первых массовых камер глубины стал сенсор Kinect, выпущенный в 2010 году для игровой приставки, и робототехники почти сразу начали использовать его в своих разработках.
Лидар устроен иначе. Он посылает лазерные импульсы и засекает, через сколько наносекунд каждый вернётся, отразившись от препятствия, а вращающееся зеркало или набор излучателей позволяет за доли секунды «ощупать» всё вокруг. В результате получается не картинка, а облако из сотен тысяч точек с известными координатами. Ночью и в тени лидар видит так же хорошо, как днём, зато цвета светофора не различит, да и стоит он в десятки раз дороже камеры. Сравнение всех четырёх датчиков приведено в таблице 1.
Таблица 1 — Сравнение датчиков технического зрения
| Датчик | Что измеряет | Достоинства | Ограничения | Доступность |
|---|---|---|---|---|
| Монокамера | Цветное изображение | Дешевизна, распознавание цвета и надписей | Нет прямого измерения расстояния, зависит от света | Высокая |
| Стереокамера | Изображение и глубина | Расстояние по двум изображениям | Сложные вычисления, ошибки на однотонных поверхностях | Средняя |
| RGB-D-камера | Изображение и карта глубины | Готовая карта расстояний | Небольшая дальность, хуже работает на солнце | Средняя |
| Лидар | Облако точек | Высокая точность, не зависит от освещения | Высокая цена, нет цвета | Низкая |
Из таблицы видно, что универсального датчика нет. Поэтому в сложных системах, например в беспилотных автомобилях и роботах-курьерах, используют сразу несколько видов датчиков, а их данные объединяют программно. Для школьного проекта чаще всего достаточно одной камеры, а задачу измерения расстояния можно поручить недорогому ультразвуковому датчику.
В классическом подходе каждый шаг обработки прописывает программист. Допустим, робот должен ехать за оранжевым мячом. Кадр с камеры переводят из цветовой модели RGB в HSV, где оттенок записан отдельным числом, отбирают пиксели с оттенком в нужном диапазоне, находят самый крупный контур и вычисляют координаты его центра; если центр левее середины кадра, робот поворачивает налево. Всё это делается несколькими функциями открытой библиотеки OpenCV, первую версию которой компания Intel выпустила в 2000 году, и работает даже на одноплатном компьютере Raspberry Pi. Слабое место такого решения проявляется, когда в комнате меняется свет или когда объект надо узнать не по цвету, а по облику: правило, которое отличит кошку от собаки, вручную не напишешь.
Второй подход использует свёрточные нейронные сети, которые не программируют вручную, а обучают на большом количестве размеченных примеров. Перелом в этой области произошёл в 2012 году, когда сеть AlexNet, разработанная А. Крижевским, И. Суцкевером и Дж. Хинтоном, победила в конкурсе ImageNet, где нужно было отнести фотографию к одному из тысячи классов. Как после этого менялась ошибка лучших решений конкурса, показано на рисунке 1.

За пять лет доля ошибок снизилась почти в восемь раз, а в 2015 году нейросеть ResNet показала результат лучше, чем оценка точности человека на той же задаче, около 5 %. Для робототехники особенно важным оказалось появление быстрых детекторов объектов, например сети YOLO, описанной в 2016 году, которая находит и классифицирует объекты на кадре видео в реальном времени.
На складах интернет-магазинов компьютерное зрение работает в самом простом виде. Роботы Kiva, компанию-разработчика которых в 2012 году купил Amazon, ездят под стеллажами и привозят их к сборщикам заказов, а ориентируются по двумерным штрихкодам, наклеенным на пол сеткой: камера, направленная вниз, считывает код и сообщает роботу, в какой клетке он находится. Задача распознавания здесь намеренно упрощена, и поэтому система работает очень надёжно.
Гораздо сложнее задача у роботов, которые передвигаются среди людей. Робот-курьер «Яндекса», впервые показанный в 2019 году, ездит по тротуарам, объезжает пешеходов и останавливается перед переходом, и для этого он объединяет данные камер, лидара и других датчиков. Ещё более наглядный пример — марсоход Perseverance, совершивший посадку на Марс в 2021 году. Радиосигнал с Земли идёт до него несколько минут, поэтому управлять каждым шагом дистанционно невозможно, и марсоход сам строит по снимкам стереокамер карту поверхности и выбирает безопасный путь между камнями.
Дальше текст закрыт
В полной версии идут остальные главы, заключение и список из 5 источников по ГОСТ. Работу на эту же тему можно собрать в редакторе: план и первые страницы он делает бесплатно, а остальное открывается после оплаты.
Структура: аннотация, ключевые слова, введение с целью и задачами, материалы и методы, результаты, обсуждение, выводы и список литературы.
Технология, которая позволяет роботу получать информацию из изображений: находить объекты, определять их положение и расстояние до них, распознавать знаки и препятствия.
Камеру, одноплатный компьютер Raspberry Pi и бесплатную библиотеку OpenCV; для распознавания сложных объектов — готовые обученные нейросети.
Нет, текст опубликован в открытом каталоге, и редакция найдёт совпадения при проверке. Пример полезен как образец структуры и аннотации, а результаты статьи должны быть вашими.
Как правило, это название, аннотация, ключевые слова, введение, методы, результаты, обсуждение, выводы и список литературы. Точный порядок задают требования журнала.
Этот пример создан в Studentix и прочитан редактором перед публикацией. Он подходит как образец структуры и подачи материала, но факты и источники перед использованием стоит перепроверить, а оформление сверить с методичкой.