구글이 Gemini 3.8 Flash를 내놓았다.
이번 모델에서 가장 눈에 띄는 부분은 단순한 성능 향상이 아니다.
가격이 상당히 저렴한데 일부 벤치마크에서는 최상위급 모델과 비슷하거나 더 높은 결과가 나왔다는 점이다.
특히 소프트웨어 엔지니어링 성능을 평가하는 DeepSWE에서는 Gemini 3.8 Flash가 73.7%를 기록했다.
비교 대상으로 소개된 Claude Opus 5는 73.5%, GPT-5.6 Sol은 72.7%였다.
그렇다고 Gemini 3.8 Flash가 모든 분야에서 가장 좋은 모델이라는 뜻은 아니다.
분야에 따라 성능 차이가 상당히 컸다.
어떤 작업에서는 최상위권이었지만 실제 지식 업무나 컴퓨터 조작에서는 다른 모델에 뒤처지는 결과도 나왔다.
이번 글에서는 Gemini 3.8 Flash의 성능과 가격, 강점과 약점을 한 번에 정리해본다.
※ 아래 벤치마크와 가격은 공개된 자료에서 소개된 수치를 기준으로 작성했다. AI 모델의 가격과 벤치마크 결과는 변경될 수 있으므로 실제 사용 전 최신 정보를 확인하는 것이 좋다.
Gemini 3.8 Flash는 어떤 모델일까?
Gemini 3.8 Flash는 구글의 Gemini 계열 가운데 성능과 비용 효율을 함께 노린 모델로 볼 수 있다.
비싼 최상위 모델과 정면으로 경쟁한다기보다 상대적으로 저렴한 비용으로 높은 수준의 성능을 제공하는 쪽에 가깝다.
가격대가 훨씬 낮기 때문에 Claude Opus 5나 GPT-5.6 Sol 같은 최상위 모델과 단순하게 성능만 비교하기는 어렵다.
그런데 흥미로운 부분이 있다.
가격은 낮은데 일부 벤치마크에서는 오히려 고가 모델과 비슷하거나 더 높은 결과가 나왔다.

1. 코딩 성능은 상당히 강하다
Gemini 3.8 Flash에서 가장 눈에 띄는 결과 중 하나가 DeepSWE다.
DeepSWE는 짧은 코드를 하나 생성하는 수준을 넘어 비교적 긴 시간 동안 진행되는 소프트웨어 엔지니어링 작업을 평가하는 벤치마크다.
결과는 다음과 같다.
| 모델 | DeepSWE |
|---|---|
| Gemini 3.8 Flash | 73.7% |
| Claude Opus 5 | 73.5% |
| GPT-5.6 Sol | 72.7% |
Gemini 3.8 Flash가 73.7%로 가장 높았다.
다만 모델 사이의 차이가 크지는 않다.
따라서 이 결과 하나만 보고 Gemini 3.8 Flash가 GPT-5.6 Sol이나 Claude Opus 5보다 무조건 코딩을 잘한다고 판단하기는 어렵다.
더 눈여겨볼 부분은 따로 있다.
상대적으로 저렴한 Flash 모델이 최상위급 모델과 비슷한 수준의 코딩 성능을 냈다는 점이다.
예를 들어 여행 경비 계산기나 가계부 앱처럼 여러 기능이 연결된 웹 서비스를 만든다고 해보자.
처음 코드를 만드는 것뿐만 아니라 오류를 수정하고 기존 코드를 이해하면서 여러 기능을 연결해야 한다.
이런 작업에서는 단순 코드 생성 능력보다 긴 흐름을 유지하면서 문제를 해결하는 능력이 중요해진다.
2. 모든 코딩 테스트에서 1위는 아니다
여기서 주의할 부분이 있다.
다른 코딩 벤치마크에서는 결과가 달랐다.
Terminal Bench 2.1에서는 Gemini 3.8 Flash가 89.4%로 1위를 기록했다.
하지만 난도가 높아진 Terminal Bench 4.0에서는 19.1%를 기록하면서 Claude Opus 5와 GPT-5.6 Sol보다 낮은 결과가 나왔다.
즉,
Gemini 3.8 Flash가 코딩에 강한 것은 맞지만 모든 개발 작업에서 가장 좋은 모델이라고 보기는 어렵다.
AI 모델을 비교할 때 벤치마크 하나만 봐서는 안 되는 이유다.

3. 실제 지식 업무에서는 중상위권
문서 처리나 데이터 분석 같은 일반적인 업무에서는 어떨까?
이를 확인할 수 있는 벤치마크 중 하나가 GDPval이다.
PDF 정보 추출, 데이터 분석, 프레젠테이션 제작 등 실제 업무와 가까운 작업을 평가한다.
결과는 다음과 같다.
| 모델 | GDPval |
|---|---|
| Claude Opus 5 | 1,824 |
| GPT-5.6 Sol | 1,710 |
| Gemini 3.8 Flash | 1,545 |
이 분야에서는 Gemini 3.8 Flash가 Claude Opus 5와 GPT-5.6 Sol보다 낮았다.
즉,
복잡한 자료를 분석하거나 여러 단계를 거치는 지식 업무에서는 GPT-5.6 Sol이나 Claude Opus 5가 더 좋은 결과를 낼 수 있다.
예를 들어 수십 장짜리 보험 약관을 비교하거나 여러 기업의 재무자료를 종합해서 분석한다고 해보자.
이런 작업에서는 단순한 속도보다 정확한 자료 해석과 여러 정보의 연결 능력이 더 중요하다.
반대로 단순한 자료 분류나 반복적인 데이터 처리처럼 처리량이 많은 작업이라면 Gemini 3.8 Flash의 낮은 가격이 더 큰 장점이 될 수 있다.

4. 법률 벤치마크에서는 1위
Gemini 3.8 Flash가 의외로 강한 분야가 있다.
바로 법률이다.
Harvey Legal Benchmark에서 Gemini 3.8 Flash는 61.4%로 1위를 기록했다.
법률 문서 분석이나 계약 관련 작업처럼 특정 전문 분야에서는 상당한 경쟁력이 있다는 의미다.
다만 벤치마크 1위가 곧바로 실제 모든 법률 업무에서 가장 뛰어나다는 뜻은 아니다.
법률은 국가별 법령과 판례가 다르고 최신 정보도 중요하기 때문에 실제 활용에서는 전문가 검토가 필요하다.
그래도 한 가지는 분명하다.
AI마다 잘하는 분야의 차이가 점점 커지고 있다.
5. Humanity’s Last Exam에서도 강했다
고난도 추론 능력을 평가하는 Humanity’s Last Exam에서도 Gemini 3.8 Flash는 55.9%로 1위를 기록했다.
흥미로운 것은 같은 모델인데도 분야에 따라 결과가 상당히 다르다는 점이다.
Gemini 3.8 Flash는
- 코딩에서는 최상위권
- 고난도 추론에서도 최상위권
- 법률에서도 최상위권
- 일반 지식 업무에서는 중상위권
이라는 모습을 보였다.
이제는 단순하게
“어떤 AI가 제일 좋은가?”
라고 묻는 것만으로는 부족하다.
“내가 하려는 작업에서 어떤 AI가 가장 좋은가?”
를 따져야 한다.
6. 컴퓨터를 직접 조작하는 능력은?
OSWorld는 AI가 컴퓨터나 브라우저를 얼마나 잘 조작할 수 있는지를 평가하는 벤치마크다.
Gemini 3.8 Flash의 결과는 59%였다.
반면 Claude Opus 5는 75%였다.
차이가 상당하다.
따라서 브라우저를 직접 조작하거나 여러 프로그램을 넘나들면서 작업하는 AI 에이전트 용도라면 Gemini 3.8 Flash가 항상 최고의 선택이라고 보기는 어렵다.
워프센스 뉴스레터 구독하기
1,700 + 이상 구독중 – 무료 진짜 정보, 놓치면 손해!
구독은 언제든지 해지할 수 있습니다.

7. Gemini 3.8 Flash 가격은?
이번 모델에서 성능만큼 주목할 부분이 가격이다.
공개된 출시 가격은 다음과 같다.
| 구분 | 가격 |
|---|---|
| 입력 100만 토큰 | $0.75 |
| 출력 100만 토큰 | $3.75 |
상당히 낮은 가격이다.
다만 이 가격은 초기 가격이다.
공개된 자료에 따르면 이후에는
- 입력 100만 토큰당 $1.50
- 출력 100만 토큰당 $7.50
수준으로 변경될 예정이다.
따라서 현재 가격만 가지고 장기간 사용할 비용을 계산해서는 안 된다.
그럼에도 가격 경쟁력은 상당하다.
8. 중요한 것은 단순히 토큰 가격이 아니다
AI 가격을 비교할 때 흔히 보는 것이 100만 토큰당 가격이다.
하지만 이것만 보면 실제 비용을 정확하게 비교하기 어렵다.
예를 들어 A 모델의 토큰 가격이 B 모델보다 절반이라고 해보자.
그런데 같은 작업을 끝내기 위해 두 배의 토큰을 사용한다면 실제 작업 비용은 비슷해진다.
따라서 AI 모델의 가성비를 비교하려면
토큰 가격 + 작업 완료에 필요한 토큰량 + 실제 결과물의 품질
을 함께 봐야 한다.
Gemini 3.8 Flash가 주목받는 이유도 여기에 있다.
가격만 싼 것이 아니라 일부 중요한 벤치마크에서 최상위급 모델과 경쟁할 정도의 성능까지 보여주고 있기 때문이다.
9. 실제 결과물에서는 편차가 있었다
벤치마크 숫자만으로 실제 사용감을 모두 알 수는 없다.
실제 제작 테스트에서는 결과의 편차도 확인됐다.
3D 로우폴리 환경을 만드는 테스트에서는 Gemini 3.8 Flash가 괜찮은 결과를 보여줬지만 디테일에서는 GPT-5.6 Sol보다 부족하다는 평가가 나왔다.
웹사이트 제작 역시 결과물에 따라 차이가 있었다.
일부 페이지는 괜찮았지만 디자인이나 완성도가 떨어지는 사례도 있었다.
반대로 3D 에베레스트 지형도를 만드는 테스트에서는 상당히 좋은 결과가 나왔다.
확대와 축소, 회전은 물론이고 단면을 확인하거나 여러 지점을 선택할 수 있는 인터랙티브 결과물까지 구현했다.
같은 모델이라도 어떤 작업을 시키느냐에 따라 결과 차이가 크다는 것을 보여준다.
Gemini 3.8 Flash는 누가 사용하면 좋을까?
현재 공개된 결과를 기준으로 보면 다음과 같은 경우에 특히 관심을 가져볼 만하다.
개발 작업이 많은 경우
DeepSWE 결과가 상당히 좋았다.
긴 호흡의 소프트웨어 엔지니어링 작업에서 최상위 모델과 경쟁할 만한 성능을 보여줬다.
AI 사용량이 많은 경우
AI를 많이 사용할수록 작은 가격 차이도 커진다.
하루에 몇 번 질문하는 정도라면 큰 차이가 없을 수 있다.
하지만 대량의 데이터를 처리하거나 API를 지속적으로 사용한다면 비용 차이가 상당해질 수 있다.
Gemini 3.8 Flash가 매력적인 이유다.
특정 전문 업무를 반복하는 경우
법률처럼 Gemini 3.8 Flash가 특히 강한 분야도 있다.
반대로 자신이 주로 하는 업무에서는 GPT-5.6 Sol이나 Claude Opus 5가 더 좋은 결과를 낼 수도 있다.
가장 정확한 방법은 자신이 실제로 자주 하는 작업을 몇 가지 정해서 같은 조건으로 테스트하는 것이다.

Gemini 3.8 Flash 장점과 단점
장점
- DeepSWE 코딩 벤치마크 최상위권
- 법률 벤치마크 강세
- 고난도 추론 테스트 강세
- 낮은 토큰 가격
- 가격 대비 높은 성능
단점
- 일반 지식 업무에서는 최상위 모델보다 낮은 결과
- 고난도 코딩 벤치마크에서는 성능 편차가 있음
- 컴퓨터 조작 성능에서는 다른 모델이 더 강한 결과도 있음
- 디자인 결과물은 작업에 따라 편차가 있음
Gemini 3.8 Flash vs GPT-5.6 Sol, 무엇을 써야 할까?
두 모델 가운데 하나가 무조건 더 좋다고 말하기는 어렵다.
코딩과 가격 효율을 중요하게 본다면 Gemini 3.8 Flash가 상당히 매력적이다.
반면 복잡한 지식 업무나 실제 결과물의 완성도를 중요하게 보는 작업에서는 GPT-5.6 Sol이 더 좋은 결과를 낼 수 있다.
따라서 가장 현실적인 방법은 하나의 AI만 고집하는 것이 아니다.
자신이 자주 하는 작업을 몇 가지 정한다.
같은 작업을 Gemini 3.8 Flash와 GPT-5.6 Sol에 각각 시켜본다.
결과의 정확도와 속도, 비용을 비교한다.
그다음 작업별로 더 잘하는 AI를 선택하면 된다.
정리
Gemini 3.8 Flash의 가장 큰 특징은 단순히 새로운 Gemini가 나왔다는 것이 아니다.
상대적으로 저렴한 Flash 모델이 일부 분야에서는 GPT-5.6 Sol이나 Claude Opus 5 같은 최상위 모델과 경쟁할 정도로 올라왔다는 점이다.
특히 코딩, 법률, 고난도 추론에서는 상당히 인상적인 결과를 보여줬다.
반면 모든 분야에서 최고는 아니다.
실제 지식 업무나 일부 에이전트 작업에서는 다른 모델이 더 좋은 결과를 보였다.
앞으로 AI를 선택할 때는
“무조건 어떤 모델이 최고인가?”
보다
“이 작업에는 어떤 모델이 가장 잘 맞는가?”
를 따지는 것이 더 중요해질 것으로 보인다.
자주 묻는 질문
Gemini 3.8 Flash가 GPT-5.6 Sol보다 좋은가요?
모든 분야에서 그렇지는 않다.
DeepSWE에서는 Gemini 3.8 Flash가 73.7%, GPT-5.6 Sol이 72.7%로 Gemini가 조금 높았다.
반면 GDPval 같은 지식 업무 벤치마크에서는 GPT-5.6 Sol이 더 높은 결과를 기록했다.
Gemini 3.8 Flash는 코딩에 좋은가요?
DeepSWE에서는 73.7%로 매우 높은 결과를 기록했다.
다만 다른 고난도 코딩 벤치마크에서는 상대적으로 낮은 결과도 나왔기 때문에 모든 개발 작업에서 최고라고 단정하기는 어렵다.
Gemini 3.8 Flash 가격은 얼마인가요?
공개된 초기 가격 기준으로 입력 100만 토큰당 $0.75, 출력 100만 토큰당 $3.75다.
이후에는 각각 $1.50, $7.50으로 변경될 예정이라고 알려졌다.
Gemini 3.8 Flash와 GPT-5.6 Sol 중 어떤 것을 선택해야 하나요?
코딩과 비용 효율이 중요하다면 Gemini 3.8 Flash를 테스트해볼 만하다.
복잡한 지식 업무나 다양한 실제 작업을 수행한다면 GPT-5.6 Sol과 직접 비교해보는 것이 좋다.
한 가지 모델만 사용하는 것보다 작업에 따라 모델을 나누어 사용하는 방식이 더 효율적일 수 있다.

