EP3-보고 듣고 말하는 ChatGPT: 멀티모달 경험의 확장

보고 듣고 말하는 ChatGPT: 멀티모달 경험의 확장

EP-02에서 살펴본 변화는 ChatGPT를 얼마나 자주, 어떤 조건으로 사용할지 선택하게 됐다는 점이었습니다. 다음 변화는 질문을 입력하는 방식 자체에 관한 것이었습니다. 사용자는 더 이상 모든 내용을 문장으로 옮겨 적지 않아도 대화를 시작할 수 있게 됐습니다. 사진을 보여주고 묻거나, 말로 질문하고 음성으로 답을 들을 수 있게 됐기 때문입니다.

OpenAI는 2023년 9월 25일 ChatGPT가 이미지와 음성을 다루는 경험으로 확장된다고 발표했습니다. 당시 발표는 이미지 기반 대화와 음성 대화를 소개했지만, 모든 기능이 모든 사용자에게 동시에 제공된 것은 아니며 단계적으로 제공된다고 안내했습니다. 따라서 당시 발표된 기능과 현재 이용 가능한 기능의 범위·조건은 구분해서 확인해야 합니다. ChatGPT can now see, hear, and speak

중요한 변화는 기능의 개수가 아닙니다. 사람과 ChatGPT 사이에 오가는 자료의 형태가 텍스트에만 머물지 않게 됐다는 점입니다.

이미지를 보여주고 묻는 경험

텍스트 대화만 가능할 때는 사진이나 문서의 내용을 먼저 글로 설명해야 했습니다. 이미지 입력이 가능해지면서 사용자는 대상 자체를 대화에 가져올 수 있게 됐습니다. 여행지에서 본 표지판의 뜻을 묻거나, 집 안 물건의 사용법을 확인하거나, 손으로 적은 메모를 정리해 달라고 요청하는 식입니다.

개인 업무에서도 활용 장면은 달라집니다. 회의 자료의 화면 캡처를 보여주고 핵심 내용을 묻거나, 표와 도표에서 확인할 항목을 정리하는 데 도움을 받을 수 있습니다. 질문을 만들기 위해 자료를 다시 옮겨 적는 단계가 줄어든다는 것이 체감되는 변화입니다. 다만 이미지의 내용을 정확히 인식하거나 업무 판단에 필요한 해석을 완전히 대신한다고 보기는 어렵습니다.

이미지를 올렸다고 해서 모든 세부 내용을 정확하게 읽거나 상황을 완전히 이해한다고 볼 수는 없습니다. 작은 글씨, 흐릿한 사진, 복잡한 표는 틀리게 해석될 수 있습니다. 중요한 숫자나 결정에 영향을 주는 내용은 원본과 대조해야 합니다. 이미지에 다른 사람의 얼굴, 연락처, 문서 정보가 들어 있다면 공유해도 되는 자료인지 먼저 확인해야 합니다.

말로 묻고 듣는 경험

음성 기능은 ChatGPT를 사용하는 장소와 상황을 넓혔습니다. 음성 입력으로 이동 중 떠오른 생각을 말로 남기거나 질문할 수 있고, 음성 출력으로 답변을 읽는 대신 들을 수 있습니다. 음성 대화를 지원하는 환경에서는 질문과 답변을 소리로 주고받는 실시간 상호작용도 가능합니다. 외국어 표현을 소리 내어 연습하는 방식처럼, 텍스트 화면과 다른 경험을 만들 수 있습니다.

개인 업무에서는 초안의 재료를 빠르게 남기는 데 음성이 유용할 수 있습니다. 산책하면서 떠올린 아이디어를 말해 두고 나중에 글의 개요로 정리하거나, 발표 연습을 하면서 문장 표현을 다듬는 식입니다. 긴 내용을 타이핑하기 어려운 사람에게는 입력 장벽을 낮추는 수단이 될 수도 있습니다.

그렇다고 음성이 모든 상황에서 더 편한 것은 아닙니다. 주변에 들려서는 안 되는 내용을 말하기 어렵고, 답변을 훑어보며 비교해야 하는 작업에는 텍스트가 더 적합할 수 있습니다. 주변 사람의 대화나 제3자의 목소리처럼 녹음·전달해서는 안 되는 정보가 포함되지 않는지도 확인해야 합니다. 음성으로 들은 답변도 텍스트 답변과 마찬가지로 사실 확인이 필요합니다.

멀티모달 기능을 고르는 기준

이미지와 음성 기능을 사용할지 결정할 때는 다음 질문이 도움이 됩니다.

  1. 지금 다루려는 자료가 텍스트보다 이미지나 음성으로 전달하는 편이 적합한가?

  2. 지금 장소에서 음성 입력이나 출력을 사용해도 괜찮은가?

  3. 이미지나 음성에 포함된 개인정보 또는 다른 사람의 정보를 공유해도 되는가?

  4. 결과를 원본 자료와 대조할 수 있는가?

  5. 기준일 현재 사용하는 플랜과 환경에서 필요한 기능을 이용할 수 있는가?

이 질문은 특정 기능을 반드시 써야 한다는 뜻이 아닙니다. 짧은 문장 수정에는 텍스트가 충분하고, 사진 속 정보를 확인할 때는 이미지가 편하며, 아이디어를 빠르게 남길 때는 음성이 적합할 수 있습니다. 작업의 자료 형태와 장소, 개인정보 공유 여부, 검토 가능성에 따라 입력·출력 방식을 바꾸는 것이 멀티모달 활용의 핵심입니다.

현재 기능의 이름, 제공 플랜, 지원 환경과 사용량 제한은 바뀔 수 있습니다. 2023년 발표 당시의 단계적 제공 조건을 현재 모든 사용자에게 적용되는 조건으로 해석해서는 안 됩니다. 발행 시점에는 ChatGPT Release Notes와 해당 기능의 공식 안내를 다시 확인해야 합니다.

자료가 늘어나면 다음 질문이 생긴다

이미지와 음성을 대화에 가져올 수 있게 되면 자연스럽게 더 복잡한 자료를 다루고 싶은 요구가 생깁니다. 웹에서 최신 정보를 찾고, 파일을 읽고, 여러 자료를 비교해 정리하는 작업입니다. 다음 회차에서는 ChatGPT의 검색·파일·리서치 기능이 개인의 조사와 정리 과정을 어떻게 대화 안으로 가져왔는지 살펴봅니다.

다음 회차: EP-04 찾고 읽고 정리하는 도구: 검색·파일·리서치 활용


출처

      이 블로그의 인기 게시물

      여러 코딩 에이전트를 병렬로 운영할 때 필요한 작업공간 관리 - 오케스트레이션