【こんぴゅーたびじょん】

コンピュータビジョン とは?

最終更新:
💡 画像から、何が・どこにあるかを取り出す

画像や動画から、写っている対象の種類・位置・領域などの情報を取り出す技術分野。画像分類、物体検出、領域分割など、目的に応じた処理を行う。

📌 このページのポイント
知りたい情報に合うタスクを選ぶ同じ画像を使った出力の例画像分類りんご物体検出種類+位置領域分割画素の範囲順番に全部行う工程ではない目的によって出力が異なる
分類・検出・領域分割の出力を比べた模式図。囲み枠は位置、塗り分けは対象の画素領域を表す。
ひよこ ひよこ
写真から何が分かるの?
ペンギン先生 ペンギン先生
画像分類なら「りんごが写っている」と種類を推定し、物体検出なら「りんごがどこにあるか」も囲み枠などで示すよ。領域分割は画素ごとに種類を判定して、りんごの部分と背景を区別する。知りたい情報に合う処理を選ぶんだ。
ひよこ ひよこ
分類した後に、検出、領域分割と進むの?
ペンギン先生 ペンギン先生
必ずその順に進むわけではないよ。それぞれ出力したい情報が違うタスクなんだ。動画にも、映っている動作などを分類する処理や、画面内の動きを推定する処理がある。目的に合わせてモデルや組み合わせを選ぶよ。
ひよこ ひよこ
使うモデルはCNNだけ?
ペンギン先生 ペンギン先生
CNNは画像処理で使われるモデルの一つだよ。ほかにVision Transformerを使うものもある。モデルの名前だけで選ばず、対応するタスクや学習した対象、評価結果を確認しよう。分類用のモデルが、そのまま物体の位置も出せるとは限らないんだ。
ひよこ ひよこ
画像をそのまま渡せばいい?
ペンギン先生 ペンギン先生
モデルに合う大きさへの変更や、画素値の調整などが必要になることがあるよ。TorchVisionでも、前処理はモデルや学習済み重みの版によって違うと説明されている。指定と違う入力処理をすると、精度が下がったり、誤った出力になったりするんだ。
ひよこ ひよこ
精度が高ければ、結果を信じていい?
ペンギン先生 ペンギン先生
評価に使った条件と、実際に使う条件を確かめよう。意図的に小さな変化を加えた画像で、誤認識を引き起こす敵対的サンプルの研究もあるよ。評価の数値だけで正しさを保証せず、誤認識した場合の確認や対応も考えて使うことが大切だね。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「コンピュータビジョン」って出てきたら「画像や動画から情報を取り出す技術分野」と思えればだいたいOK!
📖 おまけ:英語の意味
「Computer Vision」 = コンピューターの視覚
💬 visionは視覚という意味だよ。画像を入力し、分類や位置などの情報を取り出す処理を、人間の視覚になぞらえて表しているんだ。

参考資料

← 用語集にもどる