본문으로 건너뛰기
기술 소식을 빠르게 전달드립니다
HYUKHO

AI

Gemini 3.8 Flash 출시 총정리: 성능·가격·3.7 차이

Gemini 3.8 Flash의 핵심 사양과 공개 성능, API 가격, 국내 이용 방법을 정리했습니다. 3.7 Flash에서 전환할 때 확인해야 할 추론 수준별 활용법과 검증 기준도 살펴봅니다.

· · 4 · AI

Gemini 3.8 Flash는 2026년 9월 2일 정식 출시된 범용 AI 모델입니다. 3.7 Flash의 빠른 응답과 낮은 단가를 유지하면서 여러 파일을 장시간 수정하고 도구를 반복 호출하는 자율 에이전트 역량을 강화했습니다. 핵심 변화는 단순한 속도 향상보다 복잡한 작업을 더 오래 이어가며 완수하는 능력에 가깝습니다. Google 공식 발표

항목주요 사양
API 모델 IDgemini-3.8-flash
입력 한도최대 1,048,576토큰
최대 출력65,536토큰
입력 형식텍스트·이미지·영상·오디오·PDF
출력 형식텍스트
추론 수준low·medium·high

Gemini 3.8 Flash와 3.7 Flash의 차이

3.7 Flash가 응답 속도와 비용 효율에 초점을 맞췄다면, 3.8 Flash는 이러한 장점을 유지하면서 장시간 에이전트 작업을 강화한 모델입니다. 여러 파일을 오가며 코드를 수정하거나 외부 도구를 반복적으로 호출하는 업무에서 차이가 두드러질 수 있습니다.

비교 기준3.7 Flash3.8 Flash
주요 강점빠른 응답과 낮은 비용기존 강점에 장시간 작업 역량 추가
적합한 작업단순 처리, 비용·지연 중심 업무다중 파일 코딩, 반복 도구 호출, 다단계 추론
전환 판단현재 품질로 충분할 때 유지복잡한 작업의 완수율 개선이 필요할 때 검토

따라서 기존 앱에서 모델 ID만 교체하기보다 실제 대표 요청으로 품질, 총 토큰 사용량, 지연 시간을 비교해야 합니다. 짧고 단순한 요청에서는 전환 효과가 크지 않을 수도 있어요.

Gemini 3.8 Flash 공개 성능은 얼마나 좋아졌나

Google이 공개한 HLE-Verified 정확도는 54.9%, Vals Finance Agent v2는 61.4%입니다. DeepSWE v1.1 장시간 소프트웨어 엔지니어링 평가에서도 여러 대형 프런티어 모델보다 높은 결과를 제시했습니다. 공개 결과를 기준으로 보면 개선의 중심은 코딩, 도구를 연계한 에이전트 작업, 전문 분야의 다단계 추론입니다. Google 공식 발표

다만 벤치마크 수치를 실제 업무 성능이나 절대적인 모델 순위로 받아들이기는 어렵습니다. 자체 측정과 외부 결과가 섞여 있고, 모델별 추론 수준·에이전트 하네스·프레임 수·벤치마크 버전도 서로 다릅니다. 별도의 공인 한국어 평가도 부족하므로 한국어 문서 작성이나 국내 개발 환경에서의 품질은 대표 작업으로 직접 검증하는 편이 안전합니다. Google DeepMind 평가 방법론

Gemini 3.8 Flash 가격과 국내 이용 방법

표준 유료 Gemini API 가격은 2026년 말까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 2027년부터 단가가 두 배로 오르므로 장기 운영 예산에는 인상 후 가격까지 반영해야 합니다. Gemini API 가격표

100만 토큰 기준2026년 12월 31일까지2027년 1월 1일부터
입력0.75달러1.50달러
출력(추론 토큰 포함)3.75달러7.50달러

같은 단가를 적용받아도 high 설정에서 추론과 출력 토큰이 늘어나면 총비용과 응답 시간이 함께 증가할 수 있어요. 대한민국에서는 Google AI Studio와 Gemini API를 이용할 수 있습니다.

무료 티어의 정확한 RPM·TPM·일일 한도는 계정과 프로젝트에 따라 달라질 수 있으므로 AI Studio에서 직접 확인해야 합니다. 소비자용 Gemini 앱 구독과 개발자용 API 요금제는 별도로 운영됩니다.

Gemini 3.8 Flash에 적합한 작업과 추론 수준

모델 사양에 따르면 Gemini 3.8 Flash는 함수 호출, 구조화 출력, 코드 실행, 파일 검색, Google 검색·지도 그라운딩, URL 컨텍스트를 지원합니다. 반면 이미지·오디오 생성과 Live API는 지원하지 않습니다. 멀티모달 데이터를 입력하는 기능과 같은 형식의 결과물을 생성하는 기능은 별개로 구분해야 해요.

추론 수준선택 기준
low분류·추출처럼 단순하고 처리량이 중요한 요청
medium품질·속도·비용의 균형이 필요한 일반 작업
high복잡한 코딩, 긴 에이전트 작업, 다단계 추론

여러 파일을 다루는 장시간 코딩과 자율 작업에는 3.8 Flash가 우선 후보입니다. 비용과 지연 최소화가 더 중요하다면 3.7 Flash를 유지하고, 깊은 추론 품질이 최우선이라면 Pro 계열도 검토할 만합니다.

전환 전에는 실제 서비스에서 자주 사용하는 요청을 기준으로 다음 세 항목을 측정하는 것이 좋습니다.

  • 결과 품질과 작업 완수율
  • 입력·출력·추론을 포함한 총 토큰 사용량
  • 평균 응답 시간과 긴 작업의 지연 편차

이 세 가지를 함께 비교해야 Gemini 3.8 Flash의 성능 개선이 실제 운영 비용과 사용자 경험으로 이어지는지 판단할 수 있습니다.

  1. Muse Spark 1.3 출시 총정리: xhigh·max 성능과 가격, 한계
  2. Claude Fable 5.1 출시: 주요 특징과 달라진 점 한눈에 보기
  3. OpenClaw 2.0 업데이트 총정리: 달라진 핵심 기능과 업데이트 주의사항

댓글

Giscus를 연결하면 댓글이 열립니다.