はじめに:画面操作までAIが担う「Web Agent」時代の到来
2026年現在、AI技術はテキスト生成やコード記述の枠を超え、人間の代わりにWebブラウザを直接操作してタスクを遂行する「Web Agent(Webエージェント)」の段階へと大きく進化しました。
これまでWeb上の情報収集やフォーム入力の自動化といえば、SeleniumやPlaywrightといった自動化ツールを用いてDOM要素を特定し、複雑なスクリプトを記述する必要がありました。しかし、Webサイトの仕様変更ごとにコードが破綻する問題に悩まされてきた方も多いのではないでしょうか。
本記事で紹介するオープンソースライブラリ「Browser-Use」は、LLM(大規模言語モデル)のマルチモーダル機能とPlaywrightを融合させ、自然言語の指示だけでWebページの構造を理解し、クリックや入力、スクロール、データ抽出を自律的に行う画期的なツールです。本ガイドでは、Browser-Useの基本概念から具体的な導入手順、実践的なスクリプト構築方法までを詳しく解説します。
Browser-Useとは?従来のスクレイピングとの決定的な違い
Browser-Useは、LLMがブラウザの画面(スクリーンショットやDOM構造)をリアルタイムに観察しながら、次のアクション(「ログインボタンをクリックする」「検索窓にキーワードを入力する」など)を段階的に判断して実行するPythonライブラリです。
- 自然言語による指示が可能:「競合サイトの価格一覧を取得して指定形式で抽出して」といった直感的な指示で動作します。
- Webサイトの仕様変更に強い:HTML構造が変わっても、LLMが視覚的・文脈的に要素を再認識するため、スクリプトが停止しにくい特徴があります。
- 動的なWebアプリ対応:JavaScriptが多用されたSPA(Single Page Application)や複数ステップのフォーム入力にも柔軟に対応できます。
Browser-Useの導入・セットアップ手順
ここからは、実際にBrowser-Useをローカル開発環境に導入する手順を解説します。
1. 事前準備と動作環境
Browser-Useを実行するには、Python 3.11以上が推奨されます。また、エージェントの頭脳となるLLMのAPIキー(OpenAI APIやAnthropic APIなど)が必要です。
2. インストール手順
端末(ターミナル)を開き、以下のコマンドを実行して必要なパッケージとブラウザバイナリをインストールします。
pip install browser-use playwright
playwright install
【実践】AIにWebタスクを命令する基本コードの実装
環境が整ったら、実際にWebサイトを操作するPythonスクリプトを作成してみましょう。以下は、最新のトレンド情報を自律的に検索・抽出する基本的なエージェントの実装例です。
自動リサーチ&情報抽出スクリプト
以下のコードは、LLMをバックエンドに使用し、Browser-Useを起動する最小構成のサンプルです。
import asyncio
import os
from langchain_openai import ChatOpenAI
from browser_use import Agent
os.environ["OPENAI_API_KEY"] = "your-api-key-here"
async def main():
llm = ChatOpenAI(model="gpt-4o")
agent = Agent(
task="GitHubのトレンドページ(https://github.com/trending)にアクセスし、本日最もStarを獲得しているPythonリポジトリ上位3件の名称と概要を取得してください。",
llm=llm,
)
result = await agent.run()
print("実行結果:", result)
if __name__ == "__main__":
asyncio.run(main())
実務で活用する設定のコツ
デフォルトではバックグラウンド(ヘッドレスモード)で動作しますが、ブラウザの動作を目視で確認したい場合は、エージェント設定時にブラウザコンテキストのオプションを指定することで、実際のブラウザ画面が起動し、AIがどこをクリックしているかをリアルタイムで確認可能です。
実務で失敗しないための運用ポイント
Browser-Useを業務自動化に組み込むにあたって、押さえておくべきポイントをまとめました。
1. タスクのゴールと制約条件を明確にする
「適当に調べて」といった曖昧な指示ではなく、「〇〇サイトに移動し、検索窓に△△と入力後、表示された上位3件のタイトルとURLを抽出して終了してください」のように、具体的なステップと終了条件を指定することで無駄なAPIトークン消費を防げます。
2. 認証情報やセッションの管理
ログインが必要な社内システムなどを操作させる場合は、プロンプト内に直接パスワードを記述するのではなく、既存のブラウザセッション(Cookie情報)を読み込んで実行させる設定を行うことで、セキュリティを担保できます。
まとめ:Web自動化の未来と今後の展望
2026年現在、Web自動化はプログラミングによって固定されたコードを書く時代から、「AIエージェントに目的を伝えて任せる」時代へと移行しました。「Browser-Use」を活用すれば、定期的なWebリサーチ、データ収集、競合情報のモニタリングなど、従来の開発コストを大幅に削減して実現可能です。
まずは小さなリサーチタスクから導入を始め、自社の業務自動化パイプラインに組み込んでみてはいかがでしょうか。
関連サイト: https://www.aegis4.net/