
Gemini 3.8 Flash 출시 총정리: 성능·가격·3.7 차이
Gemini 3.8 Flash의 핵심 사양과 공개 성능, API 가격, 국내 이용 방법을 정리했습니다. 3.7 Flash에서 전환할 때 확인해야 할 추론 수준별 활용법과 검증 기준도 살펴봅니다.
Hyuk · · 4분 · AI
Gemini 3.8 Flash는 2026년 9월 2일 정식 출시된 범용 AI 모델입니다. 3.7 Flash의 빠른 응답과 낮은 단가를 유지하면서 여러 파일을 장시간 수정하고 도구를 반복 호출하는 자율 에이전트 역량을 강화했습니다. 핵심 변화는 단순한 속도 향상보다 복잡한 작업을 더 오래 이어가며 완수하는 능력에 가깝습니다. Google 공식 발표
| 항목 | 주요 사양 |
|---|---|
| API 모델 ID | gemini-3.8-flash |
| 입력 한도 | 최대 1,048,576토큰 |
| 최대 출력 | 65,536토큰 |
| 입력 형식 | 텍스트·이미지·영상·오디오·PDF |
| 출력 형식 | 텍스트 |
| 추론 수준 | low·medium·high |
Gemini 3.8 Flash와 3.7 Flash의 차이
3.7 Flash가 응답 속도와 비용 효율에 초점을 맞췄다면, 3.8 Flash는 이러한 장점을 유지하면서 장시간 에이전트 작업을 강화한 모델입니다. 여러 파일을 오가며 코드를 수정하거나 외부 도구를 반복적으로 호출하는 업무에서 차이가 두드러질 수 있습니다.
| 비교 기준 | 3.7 Flash | 3.8 Flash |
|---|---|---|
| 주요 강점 | 빠른 응답과 낮은 비용 | 기존 강점에 장시간 작업 역량 추가 |
| 적합한 작업 | 단순 처리, 비용·지연 중심 업무 | 다중 파일 코딩, 반복 도구 호출, 다단계 추론 |
| 전환 판단 | 현재 품질로 충분할 때 유지 | 복잡한 작업의 완수율 개선이 필요할 때 검토 |
따라서 기존 앱에서 모델 ID만 교체하기보다 실제 대표 요청으로 품질, 총 토큰 사용량, 지연 시간을 비교해야 합니다. 짧고 단순한 요청에서는 전환 효과가 크지 않을 수도 있어요.
Gemini 3.8 Flash 공개 성능은 얼마나 좋아졌나
Google이 공개한 HLE-Verified 정확도는 54.9%, Vals Finance Agent v2는 61.4%입니다. DeepSWE v1.1 장시간 소프트웨어 엔지니어링 평가에서도 여러 대형 프런티어 모델보다 높은 결과를 제시했습니다. 공개 결과를 기준으로 보면 개선의 중심은 코딩, 도구를 연계한 에이전트 작업, 전문 분야의 다단계 추론입니다. Google 공식 발표
다만 벤치마크 수치를 실제 업무 성능이나 절대적인 모델 순위로 받아들이기는 어렵습니다. 자체 측정과 외부 결과가 섞여 있고, 모델별 추론 수준·에이전트 하네스·프레임 수·벤치마크 버전도 서로 다릅니다. 별도의 공인 한국어 평가도 부족하므로 한국어 문서 작성이나 국내 개발 환경에서의 품질은 대표 작업으로 직접 검증하는 편이 안전합니다. Google DeepMind 평가 방법론
Gemini 3.8 Flash 가격과 국내 이용 방법
표준 유료 Gemini API 가격은 2026년 말까지 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 2027년부터 단가가 두 배로 오르므로 장기 운영 예산에는 인상 후 가격까지 반영해야 합니다. Gemini API 가격표
| 100만 토큰 기준 | 2026년 12월 31일까지 | 2027년 1월 1일부터 |
|---|---|---|
| 입력 | 0.75달러 | 1.50달러 |
| 출력(추론 토큰 포함) | 3.75달러 | 7.50달러 |
같은 단가를 적용받아도 high 설정에서 추론과 출력 토큰이 늘어나면 총비용과 응답 시간이 함께 증가할 수 있어요. 대한민국에서는 Google AI Studio와 Gemini API를 이용할 수 있습니다.
무료 티어의 정확한 RPM·TPM·일일 한도는 계정과 프로젝트에 따라 달라질 수 있으므로 AI Studio에서 직접 확인해야 합니다. 소비자용 Gemini 앱 구독과 개발자용 API 요금제는 별도로 운영됩니다.
Gemini 3.8 Flash에 적합한 작업과 추론 수준
모델 사양에 따르면 Gemini 3.8 Flash는 함수 호출, 구조화 출력, 코드 실행, 파일 검색, Google 검색·지도 그라운딩, URL 컨텍스트를 지원합니다. 반면 이미지·오디오 생성과 Live API는 지원하지 않습니다. 멀티모달 데이터를 입력하는 기능과 같은 형식의 결과물을 생성하는 기능은 별개로 구분해야 해요.
| 추론 수준 | 선택 기준 |
|---|---|
low | 분류·추출처럼 단순하고 처리량이 중요한 요청 |
medium | 품질·속도·비용의 균형이 필요한 일반 작업 |
high | 복잡한 코딩, 긴 에이전트 작업, 다단계 추론 |
여러 파일을 다루는 장시간 코딩과 자율 작업에는 3.8 Flash가 우선 후보입니다. 비용과 지연 최소화가 더 중요하다면 3.7 Flash를 유지하고, 깊은 추론 품질이 최우선이라면 Pro 계열도 검토할 만합니다.
전환 전에는 실제 서비스에서 자주 사용하는 요청을 기준으로 다음 세 항목을 측정하는 것이 좋습니다.
- 결과 품질과 작업 완수율
- 입력·출력·추론을 포함한 총 토큰 사용량
- 평균 응답 시간과 긴 작업의 지연 편차
이 세 가지를 함께 비교해야 Gemini 3.8 Flash의 성능 개선이 실제 운영 비용과 사용자 경험으로 이어지는지 판단할 수 있습니다.
관련 글
댓글
Giscus를 연결하면 댓글이 열립니다.