gemini-nano-banana-2.1 뜯어보기 — Interactions API 호출부터 4K 토큰 3,780개의 함정까지

mini_knows·4일 전

AI 트렌드·이슈

목록 보기
124/126

안녕하세요, 미니지식공간입니다.

gemini-nano-banana-2.1이 2026년 10월 6일 GA로 풀렸습니다. 모델 ID가 버전 규칙을 깨고 제품명을 그대로 쓴 점, 그리고 이미지 출력 토큰 단가가 100만 토큰당 $60에서 $30으로 반값이 된 점이 먼저 눈에 들어온다. 그런데 요금 페이지의 각주까지 읽으면 4K 한 장의 토큰 소비량이 2,520개에서 3,780개로 늘어 있다. Nano Banana 2.1 가격을 토큰 단위로 다시 계산하고, 공식 문서의 호출 코드와 막힌 기능까지 정리한다.

세 줄 정리

  • 모델 ID는 gemini-nano-banana-2.1. 이전 세대 gemini-3.1-flash-image는 지원 종료 처리됐지만 종료 날짜는 미발표다.
  • 이미지 출력 $30/1M. 1K·2K는 약 50% 인하, 4K는 토큰이 1.5배로 늘어 약 25%만 인하. 입력은 $0.50 → $1.50/1M로 3배 인상.
  • 캐싱·함수 호출·구조화 출력·Live API 전부 미지원. 0.5K 해상도도 사라졌다.

1. 모델 ID부터: 버전 규칙이 깨졌다

이전 세대까지는 gemini-3.1-flash-image, gemini-3.1-flash-lite-image, gemini-3-pro-image처럼 기반 모델 버전이 ID에 들어갔다. 2.1은 그렇지 않다.

gemini-nano-banana-2.1      # Nano Banana 2.1  (2026-10-06 GA)
gemini-3.1-flash-image      # Nano Banana 2     (2026-05-28, deprecated)
gemini-3.1-flash-lite-image # Nano Banana 2 Lite
gemini-3-pro-image          # Nano Banana Pro
gemini-2.5-flash-image      # Nano Banana (레거시, 종료일 2027-03-15)

기반 모델은 Gemini 3.6 Flash다. 구글 딥마인드 모델 카드가 모델 의존성·아키텍처·학습 데이터 세 항목에서 각각 Gemini 3.6 Flash를 명시한다. 주의할 점은 gemini-3.6-flash라는 ID도 따로 존재하는데 그쪽은 텍스트 모델이라는 것이다. 이미지 모델은 gemini-3.6-flash-image 같은 형태가 아니라 gemini-nano-banana-2.1이다. ID를 문자열 조합으로 만들던 코드가 있다면 깨진다.

2. 호출 코드: Interactions API

공식 이미지 생성 가이드의 예제는 generateContent가 아니라 Interactions API를 쓴다. 아래는 문서에 실린 예제 그대로다(문서는 코드 샘플을 Apache 2.0으로 표기한다).

from google import genai
from PIL import Image
import base64

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input="Create a picture of a nano banana dish in a fancy restaurant with a Gemini theme",
)

with open("generated_image.png", "wb") as f:
    f.write(base64.b64decode(interaction.output_image.data))

REST도 같은 엔드포인트다.

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-nano-banana-2.1",
    "input": [
      {"type": "text", "text": "Create a picture of a nano banana dish in a fancy restaurant with a Gemini theme"}
    ]
  }'

출처: https://ai.google.dev/gemini-api/docs/image-generation

3. 해상도·비율은 response_format으로, 대문자 K 필수

interaction = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input=prompt,
    response_format={
        "type": "image",
        "mime_type": "image/jpeg",
        "aspect_ratio": "1:1",
        "image_size": "1K"
    },
)

문서가 명시적으로 경고하는 지점이 있다. image_size는 대문자 K를 써야 하며, 1k처럼 소문자로 보내면 거부된다. 그리고 2.1에는 0.5K가 없다. 가이드의 해상도 설명은 0.5K(512px)를 gemini-3.1-flash-image가 추가한 옵션으로 소개하면서 "Nano Banana 2.1에서는 지원되지 않는다"고 적는다. 썸네일용으로 0.5K를 쓰던 파이프라인은 1K로 올려야 한다.

다중 턴 편집은 previous_interaction_id로 이어붙인다.

interaction_2 = client.interactions.create(
    model="gemini-nano-banana-2.1",
    input="Update this infographic to be in Spanish. Do not change any other elements of the image.",
    previous_interaction_id=interaction.id,
    response_format={
        "type": "image",
        "mime_type": "image/jpeg",
        "aspect_ratio": "16:9",
        "image_size": "2K"
    },
)

웹·이미지 검색 그라운딩은 tools에 붙인다.

curl -s -X POST \
  "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-nano-banana-2.1",
    "input": "A detailed painting of a Timareta butterfly resting on a flower",
    "tools": [{"type": "google_search", "search_types": ["web_search", "image_search"]}]
  }'

그라운딩 과금은 월 5,000건 무료(Gemini 3.x 모델 공유), 초과분 1,000건당 $14다. 요금 페이지 각주는 한 번의 요청이 여러 검색 쿼리를 유발할 수 있고 쿼리 각각에 과금된다고 적는다. 반면 검색이 돌려준 컨텍스트는 입력 토큰으로 과금하지 않는다.

4. 토큰으로 계산한 가격: 4K만 다르게 움직였다

요금 페이지 각주가 해상도별 토큰 소비량을 직접 적어둔다. 이걸 쓰면 "반값"이라는 말이 어디까지 적용되는지 바로 보인다.

해상도NB2 토큰NB2 단가($60/1M)NB2.1 토큰NB2.1 단가($30/1M)인하율
0.5K (512px)747$0.045미지원——
1K (1024px)1,120$0.0671,120$0.0336약 50%
2K (2048px)1,680$0.1011,680$0.0504약 50%
4K (4096px)2,520$0.1513,780$0.113약 25%

검산해보면 각주와 맞는다. 3,780 × $30 / 1,000,000 = $0.1134 → $0.113. 토큰 단가는 정확히 절반이 됐는데 4K 한 장이 먹는 토큰이 1.5배가 됐으니, 두 효과가 상쇄되어 25%만 남는다.

실무적으로 더 중요한 건 2K와 4K의 간격이다. NB2에서는 $0.101 대 $0.151로 1.5배였는데, 2.1에서는 $0.0504 대 $0.113으로 2.24배가 됐다. 4K를 관성으로 쓰고 있었다면 재검토할 구간이다.

Batch 티어는 전 항목 절반이다.

해상도NB2.1 StandardNB2.1 Batch
1K$0.0336$0.0168
2K$0.0504$0.0252
4K$0.113$0.0567

5. 입력 단가 3배는 누가 체감하나

여기가 헤드라인이 가리는 부분이다.

항목NB2NB2.1배수
입력 (텍스트/이미지/비디오)$0.50 / 1M$1.50 / 1M3배 상승
출력 — 텍스트·thinking$3 / 1M$7.50 / 1M2.5배 상승
출력 — 이미지$60 / 1M$30 / 1M절반으로 하락

텍스트 프롬프트 한 줄로 이미지를 뽑는 워크로드는 입력 토큰이 수십~수백 개 수준이라 3배 인상의 절대액이 미미하다. 문제는 편집 쪽이다. 참조 이미지를 최대 14장까지 넣을 수 있는 모델이므로, 다중 참조 편집을 돌리면 입력 토큰이 생성 쪽을 압도할 수 있다. thinking을 high로 올리면 thinking 토큰도 $7.50/1M으로 함께 과금된다.

다만 입력 이미지 한 장이 몇 토큰으로 계산되는지는 공식 요금 페이지에 명시가 없다. 이 부분은 확인이 필요하다. 자신의 호출에서 실제 usage를 한 번 찍어보는 쪽이 추정보다 정확하다.

참고로 thinking 과정에서 생성되는 중간 "thought image"는 가이드가 "백엔드에서는 보이지만 과금되지 않는다"고 적는다.

6. 막힌 기능 목록을 먼저 보라

모델 카드의 기능 표가 꽤 많은 것을 미지원으로 적는다.

지원미지원
이미지 생성, 검색 그라운딩, Thinking, Batch API캐싱, 코드 실행, 함수 호출, 구조화 출력, 파일 검색, Maps 그라운딩, URL 컨텍스트, Live API, 오디오 생성, Flex·Priority 추론

캐싱이 없다는 점이 비용 설계에 직접 걸린다. 입력 단가가 3배로 오른 모델에서 동일한 참조 이미지 세트를 반복 호출하는 구조라면, 캐시로 깎을 방법이 없다는 뜻이다. 함수 호출과 구조화 출력이 없으므로 에이전트 체인 안에 이미지 생성을 툴로 끼워 넣던 구조도 그대로는 안 된다.

토큰 한도는 Gemini API 모델 페이지 기준 입력 131,072 / 출력 32,768이다. 입력은 텍스트·이미지·비디오·PDF, 출력은 이미지·텍스트다. Thinking 레벨은 minimal, medium(기본), high 세 단계다.

7. 참조 이미지 14장은 신규 수치가 아니다

가이드의 참조 이미지 표를 그대로 읽으면 이렇다.

모델객체캐릭터스타일
gemini-3.1-flash-lite-image최대 14장——
gemini-nano-banana-2.1 · gemini-3.1-flash-image최대 10장최대 4명—
gemini-3-pro-image최대 6장최대 5명최대 3장

총 14장 상한은 2.1과 NB2가 동일하다. 즉 이번 업데이트의 개선은 "몇 장 넣을 수 있나"가 아니라 "넣었을 때 얼마나 일관되게 유지되나"에 있다. 릴리스 노트도 개선 항목으로 다중 턴 캐릭터 일관성, 텍스트 렌더링, 와이드·파노라마 비율(1:4, 4:1, 1:8, 8:1)의 2K·4K 타일링 아티팩트 수정을 든다.

8. Elo 표 비판적으로 읽기

아래 수치는 전부 구글 자사 발표다. 모델 카드가 밝힌 방법론은 두 줄이다. 다양한 텍스트→이미지·편집 과제에 대한 나란히 비교 사람 평가(SxS human eval)로 Elo 산출, 팩추얼리티는 단방향 AutoRater 채점. 평가 인원, 프롬프트 수, 수행 주체, AutoRater 모델 정체는 적혀 있지 않다. 외부 독립 검증이 아니다.

편집 벤치마크2.1 (Thinking)2.1 (No Thinking)NB2NB Pro
일반 편집1026 ±12980 ±15938 ±11939 ±10
단일 캐릭터 일관성1028 ±141021 ±14981 ±10991 ±9
다중 캐릭터 일관성1106 ±141068 ±14978 ±101011 ±10
마스크·잉크 편집1049 ±151042 ±16965 ±12927 ±12
제품 일관성1024 ±18981 ±18955 ±22965 ±14
스타일화1062 ±201036 ±17991 ±12990 ±12
다중 참조 편집1066 ±221041 ±20988 ±13989 ±12

텍스트→이미지는 전반 선호도 1050 ±14 / 1015 ±13 / 990 ±7 / 935 ±8, 인포그래픽 디자인 1048 ±17 / 1001 ±17 / 961 ±12 / 912 ±12, 인포그래픽 팩추얼리티(AutoRater) 0.521 / 0.328 / 0.179 / 0.265다.

표에서 읽어야 할 두 가지.

첫째, thinking을 끄면 상당 폭이 사라진다. 다중 캐릭터 일관성 1106 → 1068, 일반 편집 1026 → 980, 제품 일관성 1024 → 981, 팩추얼리티 0.521 → 0.328이다. 지연이 중요해 thinking을 minimal로 내린다면 벤치마크 수치의 상당 부분을 포기하는 셈이다. 신뢰구간이 ±12~22 수준이므로 겹치는 항목도 있다.

둘째, Nano Banana Pro의 위치가 이상하다. 상위 등급인 gemini-3-pro-image가 텍스트→이미지 Elo 두 줄에서 935·912로 하위 등급 NB2(990·961)보다 낮다. 편집에서도 2.1 대비 전 항목 열위다. 단가는 1K·2K $0.134, 4K $0.24로 2.1의 1K $0.0336 대비 약 4배다. 구글 자사 평가라는 전제를 감안해도, Pro를 기본값으로 두고 있었다면 실제 산출물로 A/B를 돌려볼 근거는 충분하다.

9. 컨텍스트 숫자가 문서마다 다르다

  • 구글 딥마인드 모델 카드: "최대 100만 토큰 컨텍스트 윈도", 출력은 "이미지 4K 토큰, 텍스트 64K 토큰"
  • Gemini API 모델 페이지: 입력 131,072 / 출력 32,768

API로 호출할 때 적용되는 한도는 후자다. 두 문서의 표현 차이는 확인이 필요하다. 이전 세대 이미지 모델에서 넘어오면서 겪은 문서 간 불일치는 Imagen 4 종료와 Nano Banana 마이그레이션 글에서도 한 번 정리했는데, 이번에도 비슷한 패턴이다.

10. 종료일은 아직 없다

릴리스 노트의 2026-10-06 항목은 gemini-3.1-flash-image가 deprecated이며 gemini-nano-banana-2.1로 이전하라고 적고, 바로 이어서 종료 날짜 미발표(no shutdown date announced) 라고 명시한다. 2026년 10월 7일 UTC에 최종 수정된 지원 종료 문서의 Nano Banana 표도 동일하다.

모델출시일종료일권장 대체
gemini-nano-banana-2.12026-10-06미발표—
gemini-3.1-flash-image2026-05-28미발표gemini-nano-banana-2.1
gemini-3.1-flash-lite-image2026-06-30미발표—
gemini-3-pro-image2026-05-28미발표—
gemini-2.5-flash-image2025-10-022027-03-15gemini-3.1-flash-lite-image

일부 보도가 10월 29일을 마감 시한으로 언급했는데, 릴리스 노트와 지원 종료 문서 어디서도 해당 날짜를 확인하지 못했다. 보도 내용은 확인이 필요하다. 같은 문서는 표의 종료일이 "실제로 종료될 수 있는 가장 이른 날짜"이고 정확한 날짜는 사전 공지한다고 밝힌다.

11. 마이그레이션 체크리스트

  1. 모델 ID 교체: gemini-3.1-flash-image → gemini-nano-banana-2.1. 문자열 조합으로 ID를 만들던 코드가 있으면 수정한다.
  2. image_size에 0.5K를 쓰고 있었다면 1K 이상으로 변경. 대문자 K 유지.
  3. 캐싱·함수 호출·구조화 출력에 의존하는 경로가 있으면 분리한다. 2.1에서는 미지원이다.
  4. usage를 로깅해 입력 토큰 비중을 실측한다. 입력 단가가 3배가 됐다.
  5. 4K 사용 구간은 2K로 내릴 수 있는지 검토한다. 간격이 2.24배로 벌어졌다.
  6. 지연이 허용되는 배치 작업은 Batch 티어로 옮긴다. 전 항목 절반이다.
  7. thinking 레벨을 바꿀 계획이면 품질 변화를 직접 측정한다. 자사 Elo 기준으로도 minimal 쪽 하락폭이 작지 않다.

자주 묻는 질문

기존 API 코드 수정이 필요한가?
모델 ID 교체가 기본이다. 0.5K 해상도를 쓰고 있었다면 2.1에서 지원되지 않아 1K 이상으로 올려야 한다. 캐싱·함수 호출·구조화 출력을 쓰던 코드는 2.1에서 미지원이라 별도 처리가 필요하다.

Nano Banana 2.1은 무료 등급이 있나?
요금 페이지 기준 없다. Standard와 Batch 모두 Free Tier 칸의 입력·출력·그라운딩이 전부 "Not available"이다. 배포 경로에 Google AI Studio가 올라 있으므로 API 과금과 별개인 체험 범위는 확인이 필요하다.

4K도 반값인가?
아니다. $0.151 → $0.113으로 약 25% 인하다. 토큰 단가는 절반이지만 4K 한 장의 토큰이 2,520개에서 3,780개로 늘었다.

Nano Banana Pro에서 2.1로 내려도 되나?
구글 자사 Elo 표에서는 2.1이 Pro를 대부분 항목에서 앞서고, 단가도 1K 기준 약 4분의 1이다. 다만 자사 평가이고 Pro는 스타일 참조 이미지 3장을 추가로 받는다는 차이가 있다. 실제 산출물로 비교한 뒤 결정하는 편이 안전하다.

마무리

이번 업데이트를 한 문장으로 줄이면 "이미지 출력은 싸졌고 입력은 비싸졌다"다. 1K·2K 생성 중심이라면 모델 ID 교체만으로 실제 절반 효과를 본다. 4K 중심이거나 참조 이미지를 많이 넣는 편집 중심이라면 usage 로그를 먼저 찍어보는 편이 정확하다. 각주의 토큰 수가 헤드라인보다 많은 것을 말해준다.

출처

본 글은 공개 자료를 바탕으로 정리했으며, 세부 내용·수치는 원 출처·공식 문서와 대조 확인을 권장합니다. Elo·AutoRater 수치는 구글 자사 발표이며 외부 기관의 독립 검증 결과가 아닙니다. 가격은 2026년 10월 7일 기준 공식 요금 페이지 표기이며 변경될 수 있습니다.

profile
작지만 알아야 할 모든 것

0개의 댓글