AI에게 내 컴퓨터를 맡겨보았다: CLI의 아쉬움을 넘어서

회사에서는 주로 CLI 기반의 AI 도구를 사용한다. 터미널 환경에서 가볍고 빠르게 코드 작업을 도와주다 보니 업무 효율을 올리는 데는 더없이 훌륭한 동료다. 하지만 사용하면 할수록 한 가지 아쉬운 점이 눈에 밟히곤 했다.


집에서 맛본 '게으름의 특권'


집에서는 Codex를 자주 활용한다. 가끔 컴퓨터 앞에 앉아 손 하나 꼼짝하기 싫을 때, AI에게 컴퓨터 제어를 시켜놓고 구경하는 재미가 쏠쏠하다. 번거로운 반복 작업이나 브라우저 조작을 AI가 알아서 처리해 주는 경험을 하고 나면 CLI 환경으로 돌아왔을 때 가끔 불편함을 느꼈다.


CLI 기반 AI는 텍스트와 터미널 명령어 수준에 갇혀 있다 보니, 화면 전체를 보고 마우스를 움직이는 식의 '직관적인 PC 제어'는 불가능하다. "CLI에서도 화면을 보고 알아서 클릭까지 해주면 얼마나 편할까?"라는 생각이 계속 머릿속을 맴돌았다.


안 되면 직접 만든다: 스크린샷 + 마우스 제어

결국 아쉬운 사람이 우물을 파는 법. 직접 간단한 파이프라인을 만들어보았다.

  1. 화면 캡처: 현재 모니터 화면을 스크린샷으로 찍는다.

  2. 시각 분석: 캡처한 이미지를 Vision 기능이 있는 AI 모델에 전달한다.

  3. 입력 제어: AI가 분석한 UI 위치 좌표를 바탕으로 마우스 이동 및 클릭 명령을 수행한다.

그저 대강 흉내만 내보자는 생각으로 만든 조합이었는데, 결과는 생각보다 훨씬 뛰어났다.

화면 속 버튼이나 입력창의 위치를 정확히 파악하고, 내가 지시한 목적에 맞춰 스스로 마우스를 옮겨가며 과업을 수행한다. 물론, 아직은 모든 것을 맡기기엔 좀 아쉬운 부분이 있지만 그래도 데이터를 잘 누적하다보면 좋은 결과가 있을 거라 생각한다.


AI는 어디까지 발전할 것인가

단순히 코드를 작성해 주거나 문장을 요약해 주던 시대를 지나, 이제 AI는 인간이 컴퓨터를 다루는 인터페이스(GUI)를 그대로 이해하고 실행하는 '에이전트(Agent)'의 영역으로 진입했다.


개인이 직접 연동한 조잡한 구조로도 이 정도의 제어가 가능한데, 머지않아 OS 차원에서 완벽히 통합된 AI 에이전트가 등장한다면 어떻게 될까? 그때가 되면 정말로 키보드와 마우스를 잡는 행위 자체가 옛날 방식이 될지도 모른다.


기술의 발전 속도를 체감할 때마다 감탄과 동시에 약간의 경외심이 든다. 과연 AI는 어디까지 발전할 것인가.

Comments

댓글을 불러오고 있습니다.