【ブイアイティー(ビジョントランスフォーマー)】
ViT(Vision Transformer) とは?
最終更新:
💡 画像のパッチをベクトルの列にして認識する
画像を小さなパッチに分けてベクトルの列へ変換し、Transformerで処理する画像認識モデル。元のViTでは位置情報や分類用トークンも加え、画像分類に利用する。
📌 このページのポイント
ViTは画像を文章にするの?
文章そのものにはしないよ。画像をパッチという小さなブロックに分け、それぞれをベクトルに変換してTransformerへ入力する。言語モデルのトークンの列のように、パッチの列を扱うんだ。
パッチは必ず16×16ピクセル?
サイズは構成によって変わるよ。元の論文でもモデル名の末尾にパッチサイズを付け、ViT-L/16などと表している。小さく分けるとパッチの数が増え、計算量にも影響するんだ。
元の画像の位置は分かるの?
パッチのベクトルに位置の情報を加えるよ。元のViTは学習可能な位置埋め込みを使い、Transformerの自己注意で離れたパッチ同士の関係も処理するんだ。
分類結果はどう出すの?
CNNより必ず精度が高い?
まとめ:ざっくりこれだけ覚えればOK!
「ViT」って出てきたら「Transformerで画像を認識するモデル」と思えばだいたいOK!
📖 おまけ:英語の意味
「Vision Transformer」 = 画像認識にTransformerを使うモデル
💬 Visionは視覚を指すよ。画像のパッチをベクトルの列にすることで、Transformerの構造を画像認識に適用しているんだ。