제미나이 2.5는 이제 구세대입니다: 2026년 8월 기준 제미나이 3 시리즈 모델 선택 가이드

· AI & 바이브코딩

■ 1. 제미나이 2.5를 기준으로 쓴 글은 이제 맞지 않습니다

인터넷에는 아직도 제미나이 2.5 프로와 2.5 플래시를 최신 모델로 소개하는 글이 많습니다. 2026년 8월 기준으로 이 설명은 유효하지 않습니다. 구글은 2.5 세대 모델의 지원 종료 일정을 공지했고, 에이전트 플랫폼 기준으로는 2026년 10월 16일이 종료 시점으로 안내됐습니다. 플랫폼과 모델별로 날짜가 다를 수 있으므로 사용 중인 환경의 공지를 직접 확인해야 합니다.

또 하나 자주 인용되는 200만 토큰 컨텍스트도 2.5 프로 시절의 수치입니다. 현재 주력 모델의 입력 한도는 100만 토큰대이며, 세대가 바뀌면서 컨텍스트 길이보다 실제 활용 정확도와 처리 비용 쪽으로 경쟁 축이 옮겨 갔습니다.

이 글은 2.5 세대를 쓰던 프로젝트가 어떤 모델로 옮겨 가야 하는지를 기준으로 정리했습니다.

■ 2. 2026년 현행 제미나이 라인업

구글은 2026년 들어 플래시 계열을 빠른 주기로 갱신했습니다. 정식 제공 기준의 흐름은 다음과 같습니다.

- 제미나이 3.5 플래시: 2026년 5월 19일 정식 제공을 시작했습니다.

- 제미나이 3.6 플래시와 3.5 플래시 라이트: 2026년 7월 21일 정식 제공을 시작했습니다.

- 제미나이 3.7 플래시: 2026년 8월 중순 공개된 최신 플래시 모델입니다. 3.6 플래시가 나온 지 약 3주 만의 후속 공개였습니다.

프로 계열에서는 제미나이 3.1 프로가 사용됩니다. 모델 카드 기준 공개일은 2026년 2월 19일이며, API에서는 프리뷰 식별자로 제공됩니다.

이 밖에 이미지 생성용 나노 바나나 2와 나노 바나나 프로, 실시간 음성용 3.1 플래시 라이브, 음성 합성용 3.1 플래시 TTS, 실시간 번역용 3.5 라이브 트랜슬레이트, 로보틱스용 제미나이 로보틱스 ER 2 등이 용도별로 나뉘어 있습니다. 하나의 만능 모델을 고르는 방식이 아니라 작업 종류에 맞는 모델을 고르는 구조로 바뀌었다고 이해하는 편이 정확합니다.

■ 3. 제미나이 3.7 플래시 주요 사양

- 모델 식별자: gemini-3.7-flash

- 컨텍스트: 입력 1,048,576 토큰, 출력 65,536 토큰

- 입력 모달리티: 텍스트, 이미지, 비디오, 오디오, PDF

- 출력: 텍스트

- 요금: 도입 요금 기준 입력 100만 토큰당 0.75달러, 출력 100만 토큰당 3.75달러입니다. 이 요금은 2026년 12월 31일까지 적용되고, 2027년 1월 1일부터는 입력 1.50달러, 출력 7.50달러로 조정된다고 안내됐습니다.

공개된 평가 결과 가운데 대표적인 항목은 다음과 같습니다.

- 터미널벤치 2.1: 85.8%

- DeepSWE v1.1: 65.3% (3.6 플래시는 48.6%)

- FrontierCode 1.1: 43.6% (3.6 플래시는 34.4%)

- 긴 문맥 회상 평가(GDM-MRCR v2, 128k 구간): 97.0%

벤치마크 점수는 공개된 조건에서 측정된 값입니다. 실제 업무 데이터에서 같은 격차가 그대로 재현되는지는 별개의 문제이므로, 옮겨 가기 전에 자체 평가 세트를 만들어 비교하는 절차를 권합니다.

■ 4. 제미나이 3.1 프로 주요 사양

- 컨텍스트: 입력 최대 100만 토큰, 출력 6만 4천 토큰

- 입력 모달리티: 텍스트, 이미지, 오디오, 비디오

- 공개된 평가 결과: ARC-AGI-2 77.1%, GPQA 다이아몬드 94.3%, SWE-bench Verified 80.6%, 긴 문맥 평가(MRCR v2, 128k 구간) 84.9%

- 강점으로 제시된 영역: 에이전트 작업, 고난도 코딩, 긴 문맥 처리, 멀티모달 이해

흥미로운 점은 긴 문맥 회상 평가에서 최신 플래시 모델이 프로 모델보다 높은 수치를 기록했다는 것입니다. 세대 차이가 계층 차이를 넘어설 수 있다는 뜻이므로, 프로 계열이 항상 우월하다는 전제로 모델을 고르면 비용만 더 쓰게 될 수 있습니다.

■ 5. 어떤 작업에 어떤 모델을 고를까

- 대량 요약, 분류, 추출처럼 반복이 많은 작업: 플래시 라이트 계열이 단가 면에서 유리합니다.

- 코드 작성과 에이전트형 다단계 작업: 최신 플래시 모델이 기본 선택지입니다. 세대가 올라가면서 코딩과 도구 사용 항목의 개선 폭이 컸습니다.

- 난이도 높은 추론과 복합 판단: 프로 계열을 검토합니다. 다만 실제 과제에서 차이가 나는지 먼저 확인한 뒤 결정하세요.

- 실시간 음성 대화: 라이브 계열 전용 모델을 사용합니다. 일반 텍스트 모델로는 실시간 오디오 처리를 대체할 수 없습니다.

- 이미지 생성과 편집: 나노 바나나 계열을 사용합니다.

비용을 계산할 때는 입력과 출력 단가가 다르다는 점, 그리고 캐시가 적용되는 입력의 단가가 별도라는 점을 함께 고려해야 합니다. 긴 시스템 지시문을 매 요청마다 새로 보내는 구조라면 캐시 적용만으로도 청구액이 크게 달라집니다.

■ 6. 2.5 세대에서 옮겨 갈 때의 체크리스트

- 현재 코드에 하드코딩된 모델 문자열을 찾아 설정 값으로 분리합니다. 다음 세대 교체 때 수정 범위가 크게 줄어듭니다.

- 사고 과정 관련 설정 이름이 세대에 따라 바뀌었으므로 해당 파라미터를 확인합니다.

- 출력 토큰 한도를 확인합니다. 긴 문서를 생성하는 작업이라면 출력 상한이 실제 제약이 됩니다.

- 2.5 세대와 새 모델의 응답을 같은 입력으로 비교하는 평가 세트를 만듭니다. 최소 수십 건 규모면 경향 파악에는 충분합니다.

- 프롬프트를 그대로 옮기지 말고 다시 손봅니다. 세대가 바뀌면 같은 지시문이라도 반응이 달라집니다.

- 지원 종료 일정을 캘린더에 등록하고, 마감 직전이 아니라 여유를 두고 전환합니다.

■ 7. 자주 묻는 질문

▶ 무료로 시험해 볼 수 있나요

구글 AI 스튜디오에서 계정 로그인 후 키를 발급받아 시험해 볼 수 있습니다. 무료 사용에는 요청 빈도 제한이 있으며, 무료 구간에서 보낸 데이터의 활용 정책은 유료 구간과 다를 수 있으므로 사내 데이터를 넣기 전에 약관을 확인해야 합니다.

▶ 컨텍스트가 100만 토큰이면 문서를 전부 넣어도 되나요

넣을 수는 있지만 권장되지는 않습니다. 입력이 길수록 비용과 지연이 늘고, 관련 없는 내용이 섞이면 답변 품질이 떨어질 수 있습니다. 필요한 부분만 검색해 넣는 방식과 비교해 본 뒤 결정하는 편이 좋습니다.

▶ 프리뷰 모델을 운영 서비스에 써도 되나요

프리뷰 단계 모델은 사양과 요금이 예고 없이 바뀔 수 있고 지원 기간도 짧을 수 있습니다. 운영 환경에는 정식 제공 모델을 쓰고, 프리뷰는 검증 용도로 병행하는 구성이 안전합니다.

■ 8. 용어 정리

- 컨텍스트 윈도우: 한 번의 요청에 넣을 수 있는 입력의 최대 길이입니다.

- 출력 토큰 한도: 한 번의 응답으로 생성할 수 있는 최대 길이입니다.

- 정식 제공(GA): 사양이 고정되고 지원 정책이 적용되는 단계입니다.

- 프리뷰: 기능 검증 단계로, 변경 가능성이 큽니다.

- 지원 종료(Deprecation): 모델 호출이 더 이상 제공되지 않는 일정입니다.

- 캐시 입력: 반복되는 입력을 재사용해 단가를 낮추는 방식입니다.

■ 안내

이 글은 2026년 8월 기준으로 정리한 내용입니다. AI 모델과 서비스의 사양·요금·정책은 수개월 단위로 바뀌므로, 실제 도입 전에는 각 서비스의 공식 문서를 반드시 확인하시기 바랍니다.