Agent Observation and Optimization AgentLoop (AgentLoop) は、Alibaba Cloud が提供するエンタープライズグレードのエージェント向けワンストップ自己進化型プラットフォームです。エージェントのフルスタック可観測性と監査、エージェントの評価と実験、継続的な最適化を伴うエージェントアセット管理などのコア機能を提供します。AgentLoop は、エージェントの品質、効率、コスト、セキュリティを継続的に向上させるためのデータフライホイールの構築を支援します。
大規模言語モデル (LLM) アプリケーション向けに LLM-as-a-Judge や LLM プレイグラウンド などの独立した機能のみを提供する従来の LLMOps ツールとは異なり、AgentLoop は実際の本番環境におけるエージェントアプリケーション向けに設計されています。Agent-as-a-Judge、Agent プレイグラウンド、Trace2Dataset などのシナリオベースのクローズドループ機能を提供します。これにより、エージェントは本番環境において観測可能、評価可能、最適化可能な継続的進化のフライホイールを実現できます。
AgentLoop が必要な理由
企業が LLM アプリケーションからエージェントアプリケーションへ移行するにつれて、従来の APM および LLMOps ツールは効果を発揮しなくなります。マルチステップ推論、ツール呼び出し、マルチモデル連携などのエージェント固有の特性により、次の 4 つのコア課題が生じます。
品質低下の検出が困難:エージェントのマルチステップ推論により出力品質が低下した場合、障害の特定には平均 2 時間以上かかります。つまり、問題はサポートチケットや顧客からの苦情を通じて受動的に発見されることがほとんどです。
コスト急増の原因特定が困難:異常なトークン消費量はオフピーク時の 10 倍以上に達することがありますが、きめ細やかな原因特定手法がないため、効果的な FinOps ガバナンスを実施できません。
変更リスクのブロックが困難:プロンプト、スキル、モデルへの変更には、自動化された品質ゲートがありません。変更に起因する多くの防止可能な障害が本番環境に到達し、ビジネスに損失をもたらします。
エージェントアクションの監査証跡がない:エージェントのマルチステップ実行軌跡には監査およびリプレイ機能がなく、金融や政府などの業界におけるコンプライアンストレーサビリティ要件を満たすことが困難です。
AgentLoop は、これらの問題を解決するために構築されています。エージェントのフルスタック可観測性、監査、評価、実験、アセット管理、コンテキストエンジニアリングを含むワンストップサービスを提供します。AgentLoop は、エージェントのパフォーマンスを継続的に進化させ、エージェントが使用されるほど賢くなる、つまりより良く、より速く、より安く、より安全になることを支援します。
設計原則
AgentLoop は、次の 4 つのコア設計原則に基づいて構築されています。
LLM だけでなくエージェント向けに設計:AgentLoop は、可観測性、監査、評価、実験、最適化などのコアシナリオにおいて、エージェントパラダイム向けの機能をアップグレードしています。従来の LLMOps ツールは単一のモデル呼び出しを中心に設計されており、マルチステップ推論、動的プランニング、ツールオーケストレーションなどの複雑なエージェント動作に対応できません。AgentLoop は、完全なエージェント実行軌跡を中心に据え、プランニングから実行、フィードバックまでのプロセス全体をカバーします。
エンタープライズ本番環境シナリオ向けのクローズドループ:デモレベルの独立した機能ではなく、実際のビジネスワークロード向けのエンドツーエンドのクローズドループソリューションを提供します。データ収集から品質評価、継続的な最適化に至るまでのすべての段階が、エンタープライズ本番環境向けに調整されており、高い同時実行性、高可用性、マルチチーム連携をサポートします。
エージェント的なコア機能:評価機能などのコアコンポーネント自体がエージェントであり、プロンプト、スキル、ツールを使用して柔軟に拡張できます。たとえば、Agent-as-a-Judge 評価機能は、ツールを使用し、外部システムを呼び出し、マルチステップ推論を実行して複雑な評価タスクを完了できます。これは単純なプロンプトテンプレート入力を超えています。
主流のフレームワークおよびランタイムとの完全な互換性:AgentLoop は、特定のエージェント開発フレームワークやランタイムに依存しません。Dify、LangChain/LangGraph、AgentScope、OpenClaw、Hermes などのフレームワーク、Qoder、Claude Code、Codex、Cursor などの CLI、Alibaba Cloud AgentRun、AgentTeams、ACS、サードパーティソリューションなどのランタイムと完全に互換性があります。既存のビジネスアーキテクチャに影響を与えない非侵入型統合をサポートしています。
機能
エージェントのフルスタック可観測性
AgentLoop は、Alibaba Cloud 独自のプローブ、オープンソースプローブ、クラウドサービスとの深い統合を使用して、トレース、メトリクス、ログを含む可観測性データの非侵入型エンドツーエンド収集を実現します。UModel に基づいて、Agent → Tool → Model などのエンティティ間のトポロジー関係を自動的に検出し、フルスタック Agent Ontology トポロジービューを構築します。STAROps インテリジェント診断エンジンと組み合わせることで、パフォーマンスのボトルネックとトークン消費のホットスポットを迅速に特定します。
トレースは、単一のエージェントリクエストの開始から終了までの完全な実行プロセスを記録します。これには、ユーザー入力、モデル呼び出し、ツール呼び出し、検索拡張、メモリアクセス、最終応答が含まれます。トレースを使用することで、開発者はエージェントの推論および実行パスを再構築し、遅いリクエスト、エラー、異常なツール呼び出し、バッドケースを特定できます。
エージェント動作の監査
AgentLoop は、エージェントが実行するすべてのツール呼び出しおよび意思決定分岐に対して改ざん不可能な証跡チェーンを構築し、100% のアクショントレーサビリティを実現します。プラットフォームに組み込まれた異常動作検出エンジンは、不正な操作やデータ流出などのリスクパターンをリアルタイムで識別し、数分以内にリスクアラートを発行できます。
エージェントの評価
AgentLoop は、Agent-as-a-Judge 評価パラダイムを導入しています。評価機能自体がエージェントであり、複雑なタスクプランニング、ツール使用、マルチステップ推論が可能です。実行軌跡に基づいて詳細な評価を実行し、従来の LLM-as-a-Judge 手法よりも人間の専門家の評価に近い結果を提供します。
AgentLoop は、モデル出力、RAG 検索結果、ツール呼び出し、エージェント実行軌跡の評価をサポートしています。評価機能のデータソースは、トレース、ログ、またはデータセットです。評価機能のタイプには、事前構築済み評価機能 (幻覚、正確性、タスク完了などのメトリクス用) とカスタム評価機能があります。評価結果は、バッドケースの発見、本番環境での品質監視、バージョン変更によるリグレッションの検証に使用できます。
エージェントの実験
AgentLoop は、オンライン比較実験用のプレイグラウンドを提供します。エージェントおよび LLM の実験タイプをサポートし、実際のエンタープライズエージェントの検証またはサンドボックス環境でのテストに適しています。この機能は、2026 年 6 月 30 日までに正式リリース予定です。
データセンター
AgentLoop のデータセットは、AI シナリオ向けに設計された新しいタイプのデータストレージです。従来のログストレージの上に、完全な CRUD 操作、柔軟なスキーマ、ベクトル検索、多次元分析機能を提供します。これにより、AI ランタイムデータが「読み取り専用ログ」から「管理可能なアセット」にアップグレードされます。
組み込みのパイプラインデータ処理エンジンは、大量のオンライントレースデータを、ゴールデンデータセットやバッドケースデータセットなどの高品質で再利用可能なデータアセットに変換します。マルチステップオーケストレーションプロセスをサポートします。データソース取り込み → データ削減 (フィルタリング、重複排除、サンプリング) → 特徴抽出 → ターゲットデータセットへの書き込み。このプロセス全体が自動的に実行され、手動データ処理作業の 90% 以上を節約できます。
メモリ
AgentLoop メモリは、AI エージェント向けに構築されたコアメモリレイヤーであり、永続的なメモリ機能を提供します。
セッション横断的な一貫性: 会話履歴、タスクのステータス、意思決定の根拠などの主要な情報を長期的に保持します。効率的な検索およびコンテキスト注入メカニズムを通じて、新しいインタラクションにおいてモデルに関連する背景情報を動的に提供します。
適応性の高いパーソナライゼーション: フォーマット要件やコミュニケーションスタイルといったユーザーの好みを体系的に記録し、過去の行動パターンや長期的な目標を記憶することで、モデルは高度にカスタマイズされた出力を生成できるようになります。
履歴情報に基づく深い推論:AI エージェントに記憶、学習、進化する能力を与えることで、インタラクションの継続性と知能が大幅に向上します。
メモリポリシーには、Facts、Episodic、Summary、Custom の 4 つのタイプがあります。それぞれ異なるメモリ検索および整理方法に対応し、特定のイベントから抽象的な要約まで全範囲をカバーします。
エージェントアセット
AgentLoop アセット管理は、エンタープライズエージェントのプロンプトおよびスキルに対する集中管理、バージョン管理、共同反復を提供します。エージェントアセットは、エージェントの動作ロジックを定義するコアユニットであり、エージェントのパフォーマンスは主にこのロジックの正確性と一貫性に依存します。AgentLoop により、チームはエージェントの動作をコードのように管理できます。すべての変更が追跡可能で、その効果が測定可能かつ比較可能で、リリースペースが制御可能であり、カナリアリリースと共同編集をサポートします。
利点
LLM レベルではなくエージェントレベルの可観測性
従来の LLMOps ツールは単一のモデル呼び出しのみを観測し、マルチステップ推論チェーンにおけるステップ間の因果関係や依存関係を理解できません。AgentLoop は、完全なエージェント実行軌跡を観測対象として扱います。Agent → Tool → Model トポロジーを自動的に解析し、ビジネスの観点 (ユーザーリクエストのエンドツーエンドレイテンシなど) と技術的観点 (ツール呼び出しが失敗して 3 回再試行されたなど) の両方からの分析をサポートします。
Agent-as-a-Judge 評価パラダイム
AgentLoop では、評価機能自体がエージェントであり、ツールの使用、外部ナレッジの検索、マルチステップ推論の能力を備えています。プロンプトテンプレートのみを使用してモデルの出力に対して 1 回の判断を行う LLM-as-a-Judge と比較して、Agent-as-a-Judge は実行軌跡全体をリプレイし、検証ツールを呼び出して結果の正確性を確認し、過去のベースラインデータと比較できます。これにより、人間の専門家に近い評価を提供します。
Trace2Dataset 自動データフライホイール
AgentLoop パイプラインエンジンは、オンライン環境からのリアルタイムトレースデータを自動的に構造化データセットに変換し、データクリーニングプロセスを簡素化します。フィルタリング、重複排除、サンプリング、クラスタリングなどの処理ステップを通じて、生の運用データがゴールデンデータセット、バッドケースデータセット、またはポストトレーニングデータセットに継続的に処理されます。これにより、「データが実行されるほど品質が向上する」というデータフライホイール効果が生まれます。
非侵入型でフレームワークに依存しない統合
AgentLoop は、Alibaba Cloud 独自のプローブに基づく非侵入型統合方法を提供します。ビジネスコードを変更することなく、設定のみを変更してデータ収集を完了できます。また、OpenTelemetry 標準プロトコルを通じた統合もサポートし、LangChain/LangGraph、AgentScope、Dify、OpenClaw、Hermes、LlamaIndex、Claude Agent SDK などの主流のエージェントフレームワーク、およびさまざまな自社開発エージェントシステムと互換性があります。
エンタープライズグレードのセキュリティとコンプライアンス
AgentLoop は、100% のアクショントレーサビリティを持つ監査機能を提供し、すべてのツール呼び出しおよび意思決定分岐に対して改ざん不可能な証跡チェーンを作成します。組み込みの異常動作検出エンジンは、不正な操作や機密データ漏洩などのリスクパターンをリアルタイムで識別し、金融、政府、医療などの業界におけるコンプライアンストレーサビリティおよび規制審査要件を満たすことを支援します。
コンテキストエンジニアリングによるクローズドループ最適化
AgentLoop は、メモリおよびエクスペリエンスベース (プライベートプレビュー中) を通じて、エージェントに長期的なコンテキスト機能を提供します。メモリにより、エージェントはセッション間でユーザーの背景や設定を理解でき、エクスペリエンスベースにより、エージェントは過去の実行からベストプラクティスを学習できます。両方を組み合わせることで、エージェントは各インタラクション中に関連するコンテキストを自動的に検索してランタイムに注入でき、モデルを再トレーニングすることなく「使用されるほど賢くなる」という自己進化効果を実現します。
ユースケース
インテリジェントカスタマーサービスの品質向上
企業のインテリジェントカスタマーサービスエージェントは大量の実際のユーザー会話を処理し、応答品質は顧客満足度に直接影響します。AgentLoop は、各会話ターンの品質を評価し、無関係な回答、幻覚、情報の欠落などのバッドケースを自動的に識別できます。その後、高頻度の問題をデータセットにまとめて、ターゲットを絞った最適化を行います。メモリを使用してユーザー設定の継続性を維持し、エクスペリエンスベースを使用して複雑な問題に対するベストレスポンスパターンをキャプチャすることで、カスタマーサービスエージェントの解決率とユーザー満足度を継続的に向上させることができます。
コーディングエージェントの品質保護
AI コードアシスタントや自動プログラミングツールなどのコーディングエージェントは、さまざまな品質のコードを生成します。従来のコードレビューでは、エージェントの意思決定プロセス内の推論品質をカバーできません。AgentLoop は、タスクプランニングの合理性、ツール呼び出しの正確性、コード出力の正確性など、複数の次元にわたるコーディングエージェントの実行軌跡全体の観測と評価をサポートします。これにより、チームはエージェントが本番環境に移行する前に実験を通じてバージョン変更の効果を検証し、本番環境での継続的な評価を通じて品質のリグレッションをブロックできます。
エージェントバージョンの品質ゲート
エンタープライズエージェントアプリケーションは、プロンプトチューニング、モデルアップグレード、新しいスキルの追加などの変更を頻繁に受けます。AgentLoop 実験機能により、チームは変更を実装する前に過去のデータセットに基づいて A/B テストを実施し、新しいバージョンの精度、レイテンシ、コストにおけるパフォーマンスの違いを定量化できます。評価システムを使用して自動化された品質ゲートを確立することで、リグレッションテストに合格した変更のみが本番環境にリリースされるようにし、変更関連の障害が本番環境に到達する前にブロックできます。
エージェントコストガバナンス (FinOps)
企業が複数のエージェントアプリケーションを同時に実行する場合、トークン消費とモデル呼び出しコストは急速に増加し、原因特定が困難になります。AgentLoop のフルスタック可観測性機能は、各エージェント、ツール呼び出し、モデル推論のトークン消費とレイテンシを正確に追跡します。これにより、企業は頻繁にタイムアウトして再試行をトリガーするツールや、異常なトークン消費を持つプロンプトテンプレートなどのコストホットスポットを特定できます。実験を使用してさまざまなモデルと設定のコストパフォーマンスを比較することで、エージェントに対してきめ細やかな FinOps ガバナンスを実装できます。
金融および政府向けコンプライアンス監査
金融や政府などの規制の厳しい業界では、AI システムのすべての意思決定ステップが追跡可能かつ監査可能である必要があります。AgentLoop の動作監査機能は、エージェントの実行プロセスに対する完全な証拠チェーンを提供し、時間、ユーザー、エージェントアプリケーションごとに整理された監査リプレイをサポートします。組み込みの異常動作検出エンジンは、不正な操作や機密データアクセスに対してリアルタイムで警告を提供し、企業が規制コンプライアンス要件を満たすことを支援します。
ベストプラクティス
段階的なオンボーディングパス
AgentLoop は、次の段階的なオンボーディングパスを推奨します。
可観測性から開始:独自のプローブを使用してフルスタックエージェントデータを取り込みます。5 分以内にコンソールでトレースデータを確認し、可観測性ベースラインを迅速に確立します。
データをアセットに変換:パイプラインを使用して、オンライントレースを自動的に構造化データセットに変換します。ラベリングと組み合わせてグラウンドトゥルースを構築し、ログを受動的に蓄積することから、データアセットを積極的に構築することへ移行します。
評価システムの確立:適切な評価機能を構築または選択して、オンラインビジネスのリアルタイム品質評価を実行します。同時に、データセットとバックテストを使用して、エージェントの品質測定ベースラインを確立します。
継続的な最適化ループの作成:エージェントアセットをチューニングするか、メモリおよびエクスペリエンスベースを使用してエージェントの長期的なパフォーマンスを向上させることで、データフライホイールを作成します。
評価システムの構築
評価システムは、AgentLoop データフライホイールのコアドライバーです。次のアプローチでの構築を推奨します。
構築済みの評価機能から始める: AgentLoop は、ハルシネーション、正確性、タスク完了といったメトリクス用の、すぐに使える構築済みの評価機能を提供しており、ベースラインを迅速に設定するのに最適です。
ビジネス固有のカスタム評価子 (Agent-as-a-Judge) の構築: 多段階の推論の正確性の検証やツールの呼び出しの合理性など、複雑なシナリオでは、カスタムプロンプトとスキルを作成し、人間の専門家により近い評価結果を実現します。
人間によるフィードバックでの較正: 手動ラベリングを通じて評価エージェントの精度を定期的に検証することで、評価基準を継続的に較正します。
バージョン回帰テストの確立: エージェントの各変更前に、過去の評価データセットで実験的な回帰テストを実行し、変更の影響を定量化します。
データセット管理
データセットは、評価、実験、最適化の基盤です。目的別に整理することを推奨します。
評価ベンチマークセット:人間によってレビューされた高品質サンプルのセットで、評価のゴールドスタンダードとして機能します。
バッドケースセット:評価を通じて識別された失敗ケースのコレクションで、ターゲットを絞った最適化とリグレッションテストに使用されます。
オンラインサンプリングセット:パイプラインによってオンライントレースから自動的にサンプリングされたデータセットで、継続的な監視とトレンド分析に使用されます。
実験データセット:特定の実験計画のために準備されたデータセットで、結果の比較可能性と再現性を確保します。
エージェントアセットのバージョン管理
AgentLoop は、エージェントアセットをコードのように管理することを推奨します。
プロンプトまたはスキルへの変更ごとに新しいバージョンを作成し、完全な変更履歴を維持します。
変更が本番環境に移行する前に、実験を通じてパフォーマンスへの影響を検証し、メリットまたはリスクを定量化します。
カナリアリリース機能を使用してトラフィックを段階的に増やします。オンラインメトリクスが安定していることを確認した後、すべてのトラフィックにロールアウトします。
共同編集の場合、変更所有者とレビュープロセスを明確に定義して、競合を防ぎます。
統合エコシステム
AgentLoop は、次のエージェント開発フレームワークおよびランタイム環境と完全に互換性があります。
カテゴリ | 例 |
エージェントフレームワーク | LangChain/LangGraph、AgentScope、Dify、OpenClaw、Hermes、LlamaIndex、Claude Agent SDK など |
コーディングエージェント/CLI | Qoder、Claude Code、Codex、Cursor など |
Alibaba Cloud ランタイム | AgentRun、AgentTeams、ACS |
統合プロトコル | OpenTelemetry 標準プロトコル、ARMS 自動プローブ、Python/Java SDK 手動計装、MCP Server |
制限事項
制限事項 | 説明 |
AgentSpace の数 | 単一のアカウントで複数の AgentSpace を作成して、リソースまたは権限の分離を行うことができます。デフォルトの最大数は 50 です。 |
トレース保持期間 | トレースデータはデフォルトで 30 日間保持されますが、必要に応じて調整できます。 |
評価の同時実行数 | 単一のアカウントのデフォルトの評価同時実行数の上限は 100 です。 |
クイックスタート
AgentLoop は、明確で段階的なオンボーディングパスを提供します。1 分で AgentSpace を作成し、5 分でデータ取り込みを完了し、1 時間で最初の評価を終了し、1 日以内に最初の最適化ラウンドを達成します。
AgentLoop コンソール で今すぐ開始してください。