【ぶったいけんしゅつ】

物体検出 とは?

最終更新:
💡 画像の中の「何が」「どこに」を見つけ出すAIの目

画像や動画の中から特定の物体を見つけ出し、それが何であるかを識別するとともに位置も特定する技術。自動運転や監視カメラなどで活用される。

📌 このページのポイント
物体の種類と位置を求める 入力画像 検出 モデル 検出結果 人:0.95 車:0.90 枠の位置 + 種類 + スコア 数値は例。実際の正解率を保証する値ではない
同じ画像から個々の物体の種類と位置を予測する。枠とスコアは表示例で、全物体を必ず検出できるという意味ではない。
ひよこ ひよこ
画像認識と物体検出ってどう違うの?
ペンギン先生 ペンギン先生
画像認識は広い言葉だよ。その中で画像分類は「この写真は猫」というように画像に種類を付ける。物体検出は「ここに猫、あそこに犬」というように個々の物体の種類と位置を求め、四角い枠で示すのが代表的なんだ。
ひよこ ひよこ
どんな場面で使われるの?
ペンギン先生 ペンギン先生
自動運転で歩行者・標識・信号などを見つけたり、画像中の物体の数を調べたりする用途があるよ。ただし人という種類を検出することと、その人が不審者か判断することは別。結果を何の判断に使うかも考える必要があるんだ。
ひよこ ひよこ
リアルタイムで検出できるの?
ペンギン先生 ペンギン先生
YOLOは、一つのニューラルネットワークで画像から複数の枠と種類をまとめて予測する方式だよ。最初の論文でも速い処理が報告されている。ただし速度はモデルや機器、画像サイズなどによるし、画像中の全部の物体を確実に見つけるという意味ではないんだ。
ひよこ ひよこ
枠に95%と出れば、必ず正しい?
ペンギン先生 ペンギン先生
表示されるスコアはモデルの予測に関する値で、実際の正解率をそのまま表すとは限らないよ。例えば初期YOLOのスコアには、物体の存在と枠の一致度の予測が関わる。小さい物体が密集する場面などの限界もあるので、利用条件に合う画像で見落としや誤検出を確かめるんだ。
ペンギン
まとめ:ざっくりこれだけ覚えればOK!
「物体検出」って出てきたら「画像中の物体の種類と場所を求める技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Object Detection」 = 物体の検出
💬 Objectは物体、Detectionは検出。画像を分類するだけでなく、個々の物体がどこにあるかを求めることを表すよ。

参考資料

← 用語集にもどる