適用対象:Foundry (クラシック) ポータル。 この記事は、新しい Foundry ポータルでは使用できません。
新しいポータルの詳細を確認します。
メモ
この記事のリンクは、現在表示している Foundry (クラシック) ドキュメントではなく、新しい Microsoft Foundry ドキュメントのコンテンツを開く場合があります。
埋め込みは、機械学習モデルとアルゴリズムで簡単に使用できる特別な形式のデータ表現です。 埋め込みは、テキストのセマンティックな意味の情報密表現です。 各埋め込みは浮動小数点数のベクトルであり、ベクトル空間内の 2 つの埋め込み間の距離が、元の形式の 2 つの入力間のセマンティック類似性と相関します。 たとえば、2 つのテキストが似ている場合、それらのベクター表現も似ているはずです。 Azure AI 検索 (推奨) などの検索システムと、MongoDB 仮想コアのAzure Cosmos DB、Azure SQL Database、Azure Database for PostgreSQLなどのAzure データベースでのパワー ベクターの類似性検索の埋め込み- フレキシブル サーバー。
モデルの埋め込み
埋め込みを使用すると、ベクトル空間内のセマンティック類似性をキャプチャすることで、単語を表す大きな入力で機械学習を簡単に行うことができます。 そのため、埋め込みを使用して、2 つのテキスト チャンクが意味的に関連しているか類似しているかどうかを判断し、類似度を評価するスコアを提供できます。
コサインの類似性
Azure OpenAI 埋め込みでは、多くの場合、ドキュメントとクエリの間の類似性を計算するためにコサインの類似性に依存します。
数学の観点から、コサイン類似性は、多次元空間に投影された 2 つのベクトル間の角度のコサインを測定します。 この測定値は、2 つのドキュメントのサイズが原因でユークリッド距離によって離れている場合でも、それらの間の角度が小さくなり、コサインの類似性が高くなる可能性があるため、有益です。 コサイン類似性方程式の詳細については、「 コサイン類似性」を参照してください。
類似のドキュメントを識別する別の方法として、ドキュメント間の共通語の数をカウントする方法があります。 ドキュメント サイズの拡大は、さまざまなトピック間でも検出される一般的な単語の数が多くなる可能性が高いため、この方法はスケーリングされません。 このため、コサイン類似性は、より効果的な代替手段を提供することができます。
次の手順
- Azure OpenAI と埋め込みを使用してドキュメント検索を実行する方法についてさらに詳しく知るには、embeddings チュートリアルを参照してください。
- 埋め込みを格納し、Azure Cosmos DB for MongoDB vCore、Azure Cosmos DB for NoSQL、Azure SQL Database、またはAzure Database for PostgreSQL - フレキシブル サーバーを使用してベクター(類似性)検索を実行します。
- Microsoft Fabricの Real-Time インテリジェンスの Eventhouse を Vector データベースとして使用
- 類似性検索には 、series_cosine_similarity 関数を使用します。