アプリケーションガイド

コンピュータ使用エージェント

コンピュータを使用するエージェントは、画面を見たり、カーソルを動かしたり、クリックしたり、入力したりするなど、人間と同じようにコンピュータを操作します。

2分の読書最終更新日

概要

This lets AI use any software with a graphical interface, even apps with no API.

ディープダイブ

コンピュータ使用エージェント (CUA) は、コード レベルの API ではなく、画面と入力デバイスを通じて実際のデスクトップまたは仮想デスクトップを制御します。モデルは、ディスプレイのスクリーンショット、表示内容に関する理由を受け取り、「座標 (412, 230) をクリック」、「このテキストを入力」、または「下にスクロール」などの低レベルのアクションを出力します。この認識と行動のループは、行動し、新しいスクリーンショットをキャプチャし、次の動きを決定するという繰り返しです。 CUA はピクセルとキーストロークのレベルで動作するため、Web ブラウザを駆動し、フォームに入力し、メニューを操作し、プログラム インターフェイスを公開しない従来のアプリケーションを使用できます。例には、Anthropic の Claude コンピューターの使用や OpenAI のオペレーターが含まれます。トレードオフは現実的です。画面の読み取りが遅くなる可能性があり、クリックが失敗する可能性があり、エージェントにマシンの制御を与えると安全性への懸念が生じるため、ほとんどはサンドボックスまたは監視された環境で実行されます。

技術的な洞察

エージェントにはスクリーンショットとタスクが与えられ、視覚対応モデルによって要素 (ボタン、フィールド) がピクセル座標に基づいて配置されます。オートメーション層が OS またはブラウザーに対して実行する構造化されたアクションを生成します。各アクションの後、新しいスクリーンショットによってループが終了するため、エージェントは再度行動する前に結果を認識します。信頼性は、正確な視覚的根拠と、クリックが間違った要素に到達したときの再試行または検証ロジックに大きく依存します。

戦略的影響

ビルドの選択

AI が実際の成果を向上させるかどうかは、アプリケーション レベルの設計によって決まります。

チームとワークフロー

ワークフローを適切に統合すると、ユーザーが信頼できる生産性が向上します。

リスクと安全性

適切な範囲のユースケースにより、変更の疲労と実装のリスクが軽減されます。

コンピュータを使用するエージェントの将来

モデルが UI 要素の基盤をより良くし、一部のインタラクションが生のピクセルではなく高速なアクセシビリティ ツリーに移行するにつれて、精度と速度が向上します。危険なアクションの前の確認プロンプト、制限されたサンドボックス、監査ログなど、より強力なガードレールが期待されます。デスクトップおよび Web タスクの標準ベンチマークは成熟しており、目に見える進歩を遂げています。長期的には、CUA は、支払いなどの機密性の高い操作については人間による承認ステップを維持しながら、アプリごとに信頼性の高い方を使用して、ピクセル制御と直接 API 呼び出しをブレンドする可能性があります。

現実世界の実装

ブラウザを開いて予約サイトに移動し、時間を選択し、連絡先の詳細を入力してレストランを予約するエージェント。

画面上で領収書を読み取り、API を持たないデスクトップ会計アプリに値を入力することで、経費報告書を自動化します。

エージェントが Web アプリのサインアップ フローをクリックして、すべてのボタンとフォームが機能することを確認する QA テスト。

各フィールドのラベルを読み、正しい情報を入力することで、繰り返し政府または保険の Web フォームに記入します。

リスクとガードレール

壊れたプロセスを自動化すると、既存の問題がさらに拡大する可能性があります。

チームが過剰に自動化し、必要な人間の判断を排除してしまう可能性があります。

出力が継続的に評価されないと、品質が変動する可能性があります。

実装ロードマップ

1

現在のワークフローをマッピングし、最も摩擦が大きいステップを特定します。

2

完全自動化の前に人間によるチェックポイントを定義します。

3

プロンプト、エスカレーション パス、品質基準についてユーザーをトレーニングします。

4

タスクレベルの結果を追跡して、持続的な価値を確認します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Computer-Using Agents quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

反射と自己修正のエージェント

よくある質問

What is Computer-Using Agents?

コンピュータを使用するエージェントは、画面を見たり、カーソルを動かしたり、クリックしたり、入力したりするなど、人間と同じようにコンピュータを操作します。これにより、AI は API のないアプリも含め、グラフィカル インターフェイスを備えたあらゆるソフトウェアを使用できるようになります。

コンピュータを使用するエージェントは主にどのようにソフトウェアと対話するのでしょうか?

CUA はスクリーンショットを認識し、クリックやキーストロークなどの人間のような入力アクションを発行します。

ピクセルとキーストロークのレベルで動作する主な利点は何ですか?

CUA は人間のユーザーのように動作するため、レガシー アプリケーションや API のないアプリケーションを駆動できます。

エージェントは次のアクションを決定するために何を受け取りますか?

各アクションの後、エージェントは新しいスクリーンショットをキャプチャし、認識とアクションのループを形成します。

コンピュータを使用したエージェント製品の実例は次のうちどれですか?

Claude のコンピューター使用者と OpenAI のオペレーターは、コンピューターを使用するよく知られたエージェントです。

コンピューターを使用するエージェントがサンドボックス環境で実行されることが多いのはなぜですか?

エージェントに実際のコンピュータの制御を許可することにはリスクが伴うため、隔離と監視によって潜在的な危害を軽減します。