ChatGPT, 정확히는 Codex를 포함한 OpenAI의 생태계를 보면 한 가지 확신이 든다. 이미지 생성 능력은 이제 웬만한 전문 툴과 견줘도 손색이 없다. 그림을 그리고, 사진을 편집하고, 원하는 스타일로 이미지를 뽑아내는 과정이 한 화면 안에서 매끄럽게 이어진다. 게다가 영상 편집 오픈소스 도구들과의 연동도 꽤 자연스럽다. 만들어낸 이미지를 바로 다음 작업으로 넘기는 흐름이 끊기지 않는다는 뜻이다.
여기서 한 걸음 더 나아가 음성과 영상까지 한 화면에서 만들어낸다면 어떻게 될까. 텍스트, 이미지, 음성, 영상을 하나의 인터페이스에서 넘나들며 작업할 수 있다면, 사용자 입장에서는 굳이 다른 툴을 오갈 이유가 사라진다. 이 지점에 도달하는 순간 ChatGPT는 명실상부한 AI 업계의 1인자로 올라설 가능성이 크다.
다만 걸리는 부분이 있다. 지금도 트래픽이 몰리는 시간대에는 서버가 종종 불안정해진다. 텍스트 생성만으로도 부하가 이 정도인데, 여기에 음성과 영상 생성까지 얹는다면 서버가 그 무게를 견뎌낼 수 있을지는 미지수다. 결국 기술적 완성도만큼이나 인프라의 안정성이, 이 경쟁의 승패를 가르는 변수가 될 것이다.
댓글을 불러오고 있습니다.