【ぶったいけんしゅつ】
物体検出 とは?
最終更新:
💡 画像の中の「何が」「どこに」を見つけ出すAIの目
画像や動画の中から特定の物体を見つけ出し、それが何であるかを識別するとともに位置も特定する技術。自動運転や監視カメラなどで活用される。
📌 このページのポイント
- 画像中の物体の種類と位置を検出する
- 代表的な表示方法は、物体の周りを囲むバウンディングボックス
- 歩行者や標識の検出、物体の数の把握などに使われる
- YOLOなどのモデルでも、速度や検出できる対象は条件による
画像認識と物体検出ってどう違うの?
どんな場面で使われるの?
自動運転で歩行者・標識・信号などを見つけたり、画像中の物体の数を調べたりする用途があるよ。ただし人という種類を検出することと、その人が不審者か判断することは別。結果を何の判断に使うかも考える必要があるんだ。
リアルタイムで検出できるの?
YOLOは、一つのニューラルネットワークで画像から複数の枠と種類をまとめて予測する方式だよ。最初の論文でも速い処理が報告されている。ただし速度はモデルや機器、画像サイズなどによるし、画像中の全部の物体を確実に見つけるという意味ではないんだ。
枠に95%と出れば、必ず正しい?
表示されるスコアはモデルの予測に関する値で、実際の正解率をそのまま表すとは限らないよ。例えば初期YOLOのスコアには、物体の存在と枠の一致度の予測が関わる。小さい物体が密集する場面などの限界もあるので、利用条件に合う画像で見落としや誤検出を確かめるんだ。
まとめ:ざっくりこれだけ覚えればOK!
「物体検出」って出てきたら「画像中の物体の種類と場所を求める技術」と思えばだいたいOK!
📖 おまけ:英語の意味
「Object Detection」 = 物体の検出
💬 Objectは物体、Detectionは検出。画像を分類するだけでなく、個々の物体がどこにあるかを求めることを表すよ。