AI検索を運用する企業にとって、インフラコストの増大は避けて通れない深刻な課題となっています。

特に検索リクエストのたびに発生する「クエリの埋め込み (Embedding) 」にかかる費用は、ユーザー数や検索頻度が増えるほど指数関数的に膨れ上がります。

本記事では、Vespa AIとVoyage AIが共同で提唱する「非対称検索 (Asymmetric Retrieval) 」という画期的な手法について詳しく解説します。

この技術を活用することで、検索精度を一切犠牲にすることなく、クエリ埋め込みコストを事実上ゼロに抑えることが可能になります。

AI検索のコストを増大させる「対称性」の罠

従来のAI検索システムでは、ドキュメントのインデックス時とユーザーのクエリ実行時の両方で、全く同じ埋め込みモデルを使用することが一般的でした。

この「対称的な」アプローチは構成がシンプルである反面、スケーラビリティにおいて非常に大きな非効率を抱えています。

ドキュメントの埋め込みはインデックス作成時の1回だけで済みますが、クエリの埋め込みは検索が発生するたびにリアルタイムで実行しなければなりません。

大規模なサービスで秒間10,000クエリ (10K QPS) を処理する場合、外部APIへの支払いだけで月額15,000ドルを超えるコストが発生する計算になります。

比較項目ドキュメント埋め込みクエリ埋め込み
実行頻度ドキュメントごとに1回検索リクエストごとに毎回
レイテンシ許容度高い (バッチ処理可能)極めて低い (リアルタイム)
コストインパクト無視できるほど小さい莫大なインフラ費用となる

解決策:Voyage AIの「共通ベクトル空間」による非対称検索

この問題を根本から解決するのが、Voyage AIが提供する最新の「voyage-4」モデルファミリーです。

voyage-4シリーズは、性能の異なる複数のモデルが同じベクトル空間を共有するという、極めてユニークな特性を持っています。

これにより、ドキュメントのインデックスには最も高精度な voyage-4-large を使い、検索クエリには軽量な voyage-4-nano を使うといった組み合わせが可能になります。

「非対称検索」の具体的なワークフロー

第一ステップとして、ドキュメントのインデックス作成時にはVoyage AIの強力なAPIを使用して、最高精度のベクトルを生成します。

この工程は1回限りであるため、APIコストは十分に償却することが可能です。

第二ステップでは、ユーザーからの検索クエリをVespaの検索ノード内でローカルに動作する voyage-4-nano でベクトル化します。

このモデルは極めて軽量であり、CPU上でも数ミリ秒で推論が完了するため、外部APIを呼び出す必要がありません。

Vespaによる実装とアーキテクチャの優位性

Vespaは、この非対称検索をネイティブにサポートしており、コンテナ内でモデルを直接実行する機能を備えています。

これにより、検索のクリティカルパスから外部APIへの依存を完全に排除することができます。

運用のレジリエンス向上

外部の埋め込みAPIに依存している場合、APIプロバイダーの障害やレート制限が検索サービスの停止に直結します。

非対称検索を採用すれば、クエリのベクトル化がローカルで完結するため、ネットワーク遅延や外部要因による不安定さが解消されます。

2段階ランキングによる精度と速度の両立

Vespaでは、さらに「2段階ランキング (Phased Ranking) 」を組み合わせることで、スケーラビリティを極限まで高めています。

第一段階では、バイナリ量子化されたベクトルを用いて、数ミリ秒で数億件のデータから候補を絞り込みます。

第二段階で、絞り込まれた上位候補に対してのみ高精度なベクトル計算を実行し、最終的なランキングを決定します。

XML
<!-- Vespaのスキーマ定義例:Voyage埋め込みモデルの統合 -->
<schema name="document_schema">
  <document>
    <field name="text" type="string">
      <indexing>summary | index</indexing>
    </field>
    <!-- voyage-4-largeで生成した埋め込みを格納 -->
    <field name="embedding" type="tensor<float>(x[1024])">
      <indexing>attribute | index</indexing>
      <attribute>distance-metric: angular</attribute>
    </field>
  </document>

  <rank-profile default>
    <!-- クエリ時にvoyage-4-nanoをローカル実行 -->
    <function name="query_embedding">
      <expression>embed(voyage_nano, query(user_query))</expression>
    </function>
    <first-phase>
      <expression>closeness(field, embedding)</expression>
    </first-phase>
  </rank-profile>
</schema>

ビジネスにもたらす圧倒的な価値

VespaとVoyage AIを組み合わせたこのアーキテクチャは、コスト削減以上の価値を提供します。

ベンチマークテストによれば、この手法はOpenAIの最新モデルである text-embedding-3-large と比較して、検索精度 (NDCG@10) が14%以上向上していることが確認されています。

つまり、コストを劇的に下げながら、検索品質を大幅に向上させるという、トレードオフを打破するソリューションなのです。

導入を検討すべきユースケース

  • 秒間1,000クエリを超える高負荷な検索アプリケーション
  • ミリ秒単位の低レイテンシが求められる対話型AIサービス
  • 外部APIのダウンタイムを許容できないミッションクリティカルなシステム
  • マルチテナント環境で、顧客ごとにコストと品質の最適化が必要なプラットフォーム

まとめ

AI検索のインフラ構築において、クエリ埋め込みコストは長らく「仕方のない出費」と考えられてきました。

しかし、Vespa AIとVoyage AIが実現した「非対称検索」は、その常識を完全に塗り替えます。

高性能なモデルをインデックスに、軽量なモデルをクエリに割り当てることで、検索の経済合理性とパフォーマンスを異次元のレベルで両立させることが可能です。

これからのAIネイティブな検索基盤において、このアーキテクチャは標準的な選択肢となっていくでしょう。

コスト効率と精度の両立に悩むエンジニアや意思決定者にとって、今すぐ検討すべき最良の戦略と言えます。