Azure Monitorの問題

Azure Copilot Observability Agent は、サービスの低下を特定、調査、および説明するのに役立ちます。 このような低下が発生した場合、多くの場合、コンテキストを保持し、結果をチームと共有し、時間の経過と共に問題に取り組み続けます。

イシューとなるのは、これを可能にする永続的なレコードです。 関連するシグナルを一緒に保持し、個別のアラート、リソース、または調査セッションからやり直す代わりに、トラブルシューティングを続ける共有の場所をチームに提供します。

問題とアラート

アラートと問題は、さまざまな目的に役立ちます。

アラートは、リソースで観察された特定のシグナルを表します。 監視対象のデータがアラート ルールの条件を満たしている場合にトリガーされます。

問題は、サービスの低下を調査、管理、解決するために使用される永続的なレコードです。 アラートは個々の症状を特定するのに役立ちますが、問題は、より広範な運用上の問題をチームが理解して管理するのに役立ちます。 1 つの問題が複数のアラートとリソースにまたがる可能性があり、そのライフサイクル全体にわたってインシデントの統一されたビューが提供されます。

問題の作成方法

次の 2 つの方法で問題を作成できます。

  • 詳細調査から Observability Agent による調査で生成されたコンテキストを基に作業を続行する場合。 ユーザーが開始した調査パスについては、Azure Copilot Observability Agent の詳細な調査を参照してください。
  • 自律的にAzure Copilot Observability Agent がバックグラウンドで自律操作を実行する場合。 エージェントは、構成に応じて、関連するアラートを 1 つのインシデントに関連付けたり、個々の目立つアラートを問題に昇格させたりすることで、問題を作成できます。 バックグラウンド相関パスについては、Azure Copilot Observability Agent の自律操作を参照してください。

各問題は、Azure Monitor ワークスペース (AMW) の下に保存されます。

問題を作成するには、Azure Monitor ワークスペースの 共同作成者監視共同作成者、または問題 共同作成者 ロールが必要です。 ロール管理の詳細については、 Azure portal を使用した Azure ロールの割り当てに関するページを参照してください。

問題に含まれる内容

問題は、サービスが最初の検出から継続的な調査と対応に移行する際に、サービスの低下のコンテキストを保持します。 問題の作成方法に応じて、次のものが含まれます。

  • タイトル、重大度、状態、影響時間などのメタデータを発行します。
  • これまでに収集した問題、その影響、コンテキストを要約した背景情報。
  • Azure Copilot Observability Agent によって実行される調査。これには、調査結果、分析、推奨される次の手順、および Observability Agent を使用して調査の絞り込みを継続できる機能が含まれます。
  • 問題に関連付けられている関連アラート
  • 問題の影響を受ける、または問題に接続されている関連リソース

このモデルでは、課題を、エージェント主導の調査と人による対応ワークフローの間の永続的な引き継ぎポイントにします。

問題の表示

次の場所で問題の一覧を表示できます。

  • Azure Monitor — 選択したサブスクリプションのすべての Azure Monitor ワークスペース (AMW) の問題を表示します。
  • Azure Monitor ワークスペース - 特定の AMW 内に格納されている問題を示します。

問題コンテナーとしての Azure Monitor ワークスペース

Azure Monitor ワークスペース (AMW) は、問題のコンテナーとして機能します。

サブスクリプション内のすべての問題の既定のコンテナーとして AMW を構成できます。 既定の AMW を設定すると、そのサブスクリプション内のリソースに対してアラートが発生したときに、調査プロセスによって同じワークスペースに問題が保存されます。 それらを同じワークスペースに保存すると、関連するすべての問題が一貫した場所に保存および管理されます。

サブスクリプションを Azure Monitor ワークスペースに関連付ける方法については、「Azure Monitorの問題を使用する」を参照してください。

AMW に含まれる問題の例を次に示します。

問題が含まれる Azure Monitor ワークスペースのスクリーンショット。

イシューのアクション

問題が作成または更新されると、問題アクションを使用すると、応答フローのその時点で通知または自動化されたワークフローをトリガーできます。 アクションは個々のアラートではなく、関連付けられたエンリッチされた問題に基づいているため、重大度、影響を受けるリソース、調査結果という統合されたコンテキストが含まれます。 これにより、ダウンストリームワークフローは、分離された信号に反応するのではなく、対象となる一貫性のある応答を適用するのに十分な情報が得られます。

通知がトリガーされるタイミング

通知は、次の状況で送信されます。

  • 保存された調査の結果として、または自律エージェントによって新しい問題が作成されます。
  • 問題の 重大度または状態が変更されると、既存の問題が更新されます。

サポートされているアクションの種類

次のアクションの種類がサポートされています。

  • メール (個別の受信者または Azure Resource Manager ロール)
  • SMS/テキストメッセージ
  • Voice
  • Logic Apps
  • Event Hubs
  • Azure Functions
  • 自動化運用手順書
  • Webhook をセキュリティで保護する (ServiceNow への接続に使用)
  • Webhook

アクションを構成する

問題が格納されている Azure Monitor ワークスペース (AMW) でアクション グループを使用してアクションを構成します。 1 つ以上のアクション グループを、そのワークスペースの既定のアクションとして構成できます。

問題が作成または更新されると、関連付けられている AMW に構成されたアクション グループが自動的にトリガーされます。

また、Azure Copilot Observability Agent リソース構成を使用してアクションを定義することもできます。 詳細については、Azure ポータルでAzure Copilot Observability Agent リソースを作成するを参照してください。

アクション グループの詳細については、「アクション グループ」を参照してください。

シナリオの例

次の例は、問題アクションがさまざまな応答シナリオをサポートする方法を示しています。

  • 技術的な調査とインシデント管理を ServiceNow と調整します。 セキュリティで保護された Webhook を介して ServiceNow ITOM に問題を送信します。 Azure Monitorの問題は、関連するアラート、リソース、および Observability Agent の調査結果を含む、オンコール エンジニアの技術的なワークスペースのままです。 対応する ServiceNow アラートおよび ITSM インシデントは、割り当て、エスカレーション、コミュニケーション、およびクローズをサポートします。 双方向同期を有効にすると、関連する状態の変更は両方のシステム間で調整されます。

  • チケットの作成とワークフローの統合 - ロジック アプリを使用して、問題の作成時または更新時に、Azure DevOpsや Jira などのシステムで作業項目を作成または更新します。 作業項目には、重大度、影響を受けるリソース、運用コンテキストなどの問題の詳細を含めることができます。これにより、チームは既存のエンジニアリング プロセスを通じて所有権の追跡、作業の調整、解決の管理を行うことができます。

  • インテリジェント ルーティング - Azure関数またはロジック アプリを使用して、重大度、影響を受けるサービス、影響を受けるリソースなどの問題のプロパティを検査し、問題を適切なチーム、チャネル、またはワークフローにルーティングします。 たとえば、顧客向けのアプリケーションに影響する問題をオンコール エンジニアリング チームにルーティングし、内部システムに影響する問題を別の運用ワークフローにルーティングします。

  • 問題データをダウンストリーム システムにストリーミングする — 問題ライフサイクル イベントを外部システムによる処理のためにAzure Event Hubsに送信します。 このアプローチを使用して、他の運用シグナルと共に問題データを使用および分析するカスタム ダッシュボード、運用分析、レポート パイプライン、データ レイク、または内部プラットフォームを強化します。