【こんぴゅーたびじょん】
コンピュータビジョン とは?
最終更新:
💡 画像から、何が・どこにあるかを取り出す
画像や動画から、写っている対象の種類・位置・領域などの情報を取り出す技術分野。画像分類、物体検出、領域分割など、目的に応じた処理を行う。
📌 このページのポイント
写真から何が分かるの?
分類した後に、検出、領域分割と進むの?
必ずその順に進むわけではないよ。それぞれ出力したい情報が違うタスクなんだ。動画にも、映っている動作などを分類する処理や、画面内の動きを推定する処理がある。目的に合わせてモデルや組み合わせを選ぶよ。
使うモデルはCNNだけ?
画像をそのまま渡せばいい?
モデルに合う大きさへの変更や、画素値の調整などが必要になることがあるよ。TorchVisionでも、前処理はモデルや学習済み重みの版によって違うと説明されている。指定と違う入力処理をすると、精度が下がったり、誤った出力になったりするんだ。
精度が高ければ、結果を信じていい?
評価に使った条件と、実際に使う条件を確かめよう。意図的に小さな変化を加えた画像で、誤認識を引き起こす敵対的サンプルの研究もあるよ。評価の数値だけで正しさを保証せず、誤認識した場合の確認や対応も考えて使うことが大切だね。
まとめ:ざっくりこれだけ覚えればOK!
「コンピュータビジョン」って出てきたら「画像や動画から情報を取り出す技術分野」と思えればだいたいOK!
📖 おまけ:英語の意味
「Computer Vision」 = コンピューターの視覚
💬 visionは視覚という意味だよ。画像を入力し、分類や位置などの情報を取り出す処理を、人間の視覚になぞらえて表しているんだ。