同社は主にCLIベースのAIツールを使用しています。ターミナル環境で簡単で迅速なコード作業を手助けするため、作業効率を向上させるのに優れたパートナーです。しかし、使用するほど、一つの欠点が目に浮かびました。
自宅で味わった「お菓子の特権」
家ではよくCodexを利用しています. たまにコンピュータの前に座って手を止めたくないとき、AIがコンピュータをコントロールして見るのが楽しいです. つまらない繰り返し作業やブラウザ操作をAIが取り扱う経験を経て、CLI環境に戻ると、たまに不快感を感じました。
CLIベースのAIはテキストとターミナルコマンドレベルに閉じ込められているようで、画面全体を見てマウスを動かすような「直観的なPCコントロール」は不可能だ。
できなければ自分で作る:スクリーンショット + マウスコントロール
結局誰かが井戸を売る方法 自分でシンプルなパイプラインを作ってみた。
スクリーンキャプチャ:現在のモニター画面をスクリーンショットとして撮影します。
視覚分析:撮影した画像をVision機能を搭載したAIモデルに送信します。
入力制御:AIが分析したUI位置座標に基づいてマウス移動およびクリックコマンドを実行する。
単に大強の模だけを出す考えによる組み合わせだったが、結果は思ったよりもはるかに優れたものだった。
画面のボタンや入力ウィンドウの位置を正確に把握し、私が指示した目的に合わせてマウスを動かして作業を行います。もちろん、まだすべてを任せるのはちょっと難しい部分がありますが、それでもデータをよく蓄積すれば良い結果になると思います。
AIはどこまで進化するのか
単にコードを書いたり、文句をまとめた時代を経て、今やAIは、人間がコンピュータを扱うGUIをそのまま理解して実行する「エージェント」の領域に入った。
個人が直接連携した細かい構造でさえ、この程度のコントロールが可能だが、まもなくOSレベルで完全に統合されたAIエージェントが現れたらどうなるだろうか?その時点で、本当にキーボードとマウスを捕まえる行為自体が古いやり方になるかもしれない。
テクノロジーの進歩のスピードを体感するたびに、感嘆と同時に少しの恐れを感じます。
コメントを読み込んでいます。