본문으로 건너뛰기
기술 소식을 빠르게 전달드립니다
HYUKHO

AI

구글 Gemini 3.5 Transcribe 총정리: 한국어 지원·기능·가격·제한

Gemini 3.5 Transcribe의 `verbatim`·`smart` 모드 차이와 녹음 파일용·실시간용 모델 선택 기준을 정리합니다. 한국어 지원, 정확도, API 가격, 공개 프리뷰 제한과 개인정보 조건도 함께 살펴봅니다.

· · 6 · AI

Gemini 3.5 Transcribe는 한국어를 공식 지원하는 구글의 음성·텍스트 변환 전용 모델입니다. 녹음 내용을 충실하게 보존하는 verbatim 모드와 읽기 좋은 문서로 다듬는 smart 모드를 제공하며, 저장된 음원과 실시간 음성을 각각 별도 모델로 처리합니다. 다만 현재 공개 프리뷰 단계이므로 실제 서비스에 도입하기 전에는 한국어 정확도, 처리 시간 제한, 데이터 보관 정책을 함께 확인해야 합니다.

Gemini 3.5 Transcribe란 무엇인가

구글이 2026년 8월 공개한 Gemini 3.5 Transcribe는 한국어를 포함해 85개 이상의 언어와 로캘을 지원합니다. 음성을 발화 그대로 옮길 수도 있고, 반복이나 문장부호를 정리해 읽기 편한 문서로 변환할 수도 있어요. 현재 Gemini API와 기업용 플랫폼에서 공개 프리뷰로 제공됩니다. 구글 공식 발표

가장 중요한 차이는 verbatimsmart 모드의 처리 방식입니다.

모드처리 방식적합한 용도
verbatim추임새, 반복, 말실수, 수정 전 발언까지 최대한 보존인터뷰 원문, 증언, 상담 분석
smart반복을 줄이고 문장부호·문법·숫자·날짜·목록을 정리회의 메모, 메시지, 음성 초안

예를 들어 “화요일, 아니 수요일 오후 세 시”라고 말했다면 verbatim은 화요일에서 수요일로 수정한 과정까지 남깁니다. 반면 smart는 최종 의도를 반영해 “수요일 오후 3시”에 가깝게 정리합니다. 따라서 원문 보존과 문서 가독성 가운데 어느 쪽이 중요한지 먼저 결정하는 편이 좋습니다.

녹음 파일용과 실시간용 모델의 차이

저장된 음원은 gemini-3.5-transcribe, 실시간 자막이나 음성 입력은 gemini-3.5-transcribe-live로 처리합니다. 두 모델은 입력 형식뿐 아니라 최대 처리 시간과 지원 기능도 다릅니다.

구분녹음 파일용실시간용
모델gemini-3.5-transcribegemini-3.5-transcribe-live
최대 처리 시간요청당 1시간세션당 10분
입력 형식WAV, MP3, FLAC, M4A, WebM 등원시 16비트 PCM
화자 구분최대 8명 설정미지원
단어별 타임스탬프지원미지원
중간 결과해당 없음지원
지연 시간파일 처리 방식구글 발표 기준 1초 미만

녹음 파일에서 화자 구분이나 단어별 타임스탬프를 사용하면 최대 처리 시간이 1시간에서 30분으로 줄어듭니다. 3명 이상을 구분하는 기능은 실험적으로 제공되며, 타임스탬프를 활성화하면 변환 정확도가 낮아질 수 있어 결과 검수가 필요합니다.

smart 모드는 화자 구분이나 단어별 타임스탬프와 함께 사용할 수 없습니다. 읽기 좋은 정리본과 화자·시간 정보가 포함된 원본이 모두 필요하다면 같은 음원을 목적별로 나누어 요청해야 합니다. 자세한 조건은 녹음 파일 문서실시간 문서에서 확인할 수 있습니다.

Gemini 3.5 Transcribe 한국어 지원 범위

한국어는 ko-KR 로캘로 공식 지원됩니다. 언어 자동 감지뿐 아니라 한 문장 안에서 한국어와 영어를 섞어 말하는 코드 스위칭도 지원합니다. 인명, 회사명, 제품명처럼 일반 음성 인식에서 자주 틀리는 표현은 맞춤 어휘로 등록할 수 있어요.

맞춤 어휘는 최대 1,000개까지 등록할 수 있지만, 구글은 일반적으로 100개 이하를 사용할 때 더 나은 결과를 기대할 수 있다고 안내합니다. 무작정 많은 단어를 추가하기보다 실제 녹음에서 오류가 자주 발생하는 고유명사와 전문용어부터 등록하는 편이 적절합니다.

음성 인식 정확도는 어느 정도인가

비스트리밍 모델은 Artificial Analysis의 평균 WER 평가에서 2.6%를 기록했습니다. WER은 음성 인식 결과에서 발생한 단어 삽입·삭제·대체 오류의 비율이며, 수치가 낮을수록 정확도가 높다는 의미입니다. Artificial Analysis 벤치마크

다만 2.6%는 여러 데이터셋을 합산한 평균값이며 한국어만 따로 측정한 결과는 아닙니다. 한국어 정확도를 판단하려면 실제 사용 환경에서 다음 요소를 포함한 테스트가 필요합니다.

  • 지역이나 세대에 따른 억양
  • 배경 소음과 여러 사람의 동시 발화
  • 인명·회사명·제품명 같은 고유명사
  • 날짜, 전화번호, 금액 등 한국식 영숫자 표현
  • 한국어와 영어가 섞인 발화

공개 벤치마크는 모델 간 성능을 비교하는 참고 자료로 활용하고, 도입 여부는 자체 녹음 샘플의 오류율과 검수 비용을 기준으로 판단하는 편이 안전합니다.

Gemini 3.5 Transcribe 가격

구글이 제시한 추정 유료 API 비용은 녹음 파일용이 약 0.005달러/분, 실시간용이 약 0.009달러/분입니다.

사용량녹음 파일용실시간용
1분약 0.005달러약 0.009달러
1,000분약 5달러약 9달러

표의 금액은 단순 환산한 추정치입니다. 실제 청구액은 처리된 토큰량, 환율, 세금 등에 따라 달라질 수 있으며, 공개 프리뷰가 끝난 뒤 가격 정책이 변경될 가능성도 있습니다. 서비스 비용을 산정할 때는 최신 Gemini API 가격표를 다시 확인해야 합니다.

도입 전에 확인할 기능 제한

Gemini 3.5 Transcribe는 아직 공개 프리뷰 단계입니다. 따라서 정식 출시 모델과 같은 수준의 안정성이나 장기 지원을 전제로 핵심 업무에 바로 적용하기에는 주의가 필요합니다.

주요 제한을 정리하면 다음과 같습니다.

  • 녹음 파일은 요청당 최대 1시간까지 처리할 수 있습니다.
  • 화자 구분 또는 단어별 타임스탬프를 사용하면 최대 길이가 30분으로 줄어듭니다.
  • 실시간 세션은 최대 10분까지 유지됩니다.
  • 실시간 모델에서는 화자 구분과 단어별 타임스탬프를 지원하지 않습니다.
  • smart 모드는 화자 구분 및 단어별 타임스탬프와 함께 사용할 수 없습니다.
  • 3명 이상 화자 구분은 실험적 기능이므로 별도 검증이 필요합니다.

긴 회의나 강의를 처리하려면 파일을 적절한 길이로 나누고, 분할 지점에서 문장이 잘리거나 화자 정보가 이어지지 않는 문제까지 검토해야 합니다.

무료·유료 API의 개인정보 처리 차이

무료 API에 제출한 콘텐츠와 생성 결과는 제품 개선에 활용되거나 사람이 검토할 수 있습니다. 반면 유료 API로 처리한 데이터는 제품 개선에 사용되지 않지만, 정책 위반 탐지를 위한 제한적인 로깅이 적용될 수 있습니다.

Files API에 업로드한 원본 파일은 기본적으로 48시간 후 삭제됩니다. 48시간이 지나기 전에 제거해야 한다면 직접 삭제 요청을 보내야 합니다. 세부 조건은 Gemini API 이용약관제로 데이터 보존 안내에서 확인할 수 있습니다.

회의, 상담, 인터뷰처럼 개인정보가 포함될 수 있는 녹음은 업로드 전에 조직의 개인정보 처리 정책과 녹음 동의 요건을 검토해야 합니다. 특히 민감정보나 고객 데이터가 포함된 경우에는 무료 API 사용 여부를 신중하게 결정하는 편이 좋습니다.

어떤 모드를 선택해야 하나

선택 기준은 간단합니다.

  • 회의 메모, 메시지, 음성 초안처럼 읽기 편한 결과가 필요하면 smart가 적합합니다.
  • 인터뷰, 조사, 상담 기록처럼 발화 원문을 보존해야 하면 verbatim이 알맞습니다.
  • 화자 구분이나 단어별 타임스탬프가 필요하면 녹음 파일용 모델과 verbatim을 중심으로 구성해야 합니다.
  • 실시간 자막이나 음성 입력 기능을 구현하려면 gemini-3.5-transcribe-live를 선택해야 합니다.

Gemini 3.5 Transcribe는 한국어 지원과 목적별 변환 모드가 분명한 모델입니다. 다만 공개 프리뷰라는 점과 기능 조합별 제한을 고려해, 실제 녹음 샘플로 정확도와 비용을 검증한 뒤 도입 범위를 결정하는 것이 좋습니다.

  1. OpenClaw 2.0 업데이트 총정리: 달라진 핵심 기능과 업데이트 주의사항
  2. OpenAI·Cursor 파트너십 종료 예고: 11월 12일 이후 GPT 이용 방법은?
  3. Tailscale로 NAS 원격 접속하기: 포트포워딩 없이 홈서버 연결하는 방법

댓글

Giscus를 연결하면 댓글이 열립니다.