【バイエンコーダー】
バイエンコーダー とは?
最終更新:
💡 質問と文書を別々に数値に変えて、近さを比べる
クエリと文書などの入力を別々にベクトル化し、ベクトル同士の類似度で比較する方式。文書のベクトルを事前に計算して再利用でき、検索の候補を探す用途などに使われる。
バイエンコーダーは、何を比べるの?
クロスエンコーダーとは、どう違うの?
別々に処理すると、検索が速くなる?
100万件でも必ず一瞬で探せる?
速さは索引の方式や機器、データなどによるよ。近似近傍探索なら大量の候補を効率よく探せる一方、近い文書を見逃す場合もある。速さと精度を、実際の検索データで確かめるんだ。
必須ではないよ。検索した候補をクロスエンコーダーで並べ直す構成はあるけれど、候補数や再評価の必要性は用途による。どのモデルが常に高精度と決めず、検索結果の質と処理時間を評価して選ぶんだ。
まとめ:ざっくりこれだけ覚えればOK!
「バイエンコーダー」って出てきたら「入力を別々にベクトル化して比較する方式」と思えばだいたいOK!
📖 おまけ:英語の意味
「Bi-Encoder」 = 2つの入力を別々に符号化する方式
💬 Biは2つを表すよ。ここではクエリと文書などを別々に処理すること。同じモデルで両方を処理する実装もあり、必ず異なる2つのモデルを用意するという意味ではないんだ。