Gemini 3.1 Pro 출시 - 그래서 Claude 버릴 만한가?

유진·2026년 2월 20일

목록 보기
3/18
post-thumbnail

오늘 새벽, Google이 Gemini 3.1 Pro를 공개했다.
현재는 프리뷰 상태고 곧 GA 예정이라는데,
GA가 뭐냐면 그냥 정식 출시라고 생각하면 된다.

참고로 지난주에 Gemini 3 Deep Think 업데이트가 먼저 나왔고, 이번 3.1 Pro는 그걸 가능하게 한 "코어 인텔리전스 업그레이드"라는 게 Google의 설명이다.

뭐가 바뀌었냐

공식 블로그를 살펴봤는데 거기서 수치로 언급한 건 딱 하나다.

ARC-AGI-2: 77.1% (Gemini 3 Pro 대비 2배 이상)

ARC-AGI-2는 완전히 새로운 논리 패턴을 푸는 능력을 측정하는 벤치마크다.
단순 암기나 패턴 매칭이 아니라 실제 추론 능력에 가깝다는 점에서 의미 있는 지표다.
3 Pro가 31.1%였으니까 77.1%면 꽤 큰 폭이다.

3rd party 자료 기준으로 추가 벤치마크도 돌았는데,
하나하나 보긴 그렇고 대충 좋아졌다~ 참고 정도로만 살펴보면 다음과 같다.

접근 방법은?

  • 개발자: Gemini API (AI Studio), Gemini CLI, Antigravity, Android Studio
  • 기업: Vertex AI, Gemini Enterprise
  • 소비자: Gemini 앱 (Pro/Ultra 플랜 한도 상향), NotebookLM (Pro/Ultra 전용)

가격은 입력 $2/M, 출력 $12/M. Opus 4.6($5/$25) 대비 절반 이하다.

근데 실제로 쓸 만한가

GeekNews에서 수집한 Hacker News에 따르면 반응은 엇갈린다.

긍정 측: "UI + 데이터 동기화 레이스 컨디션을 단번에 해결", "Opus 4.6이 세 번 걸린 문제를 한 번에 품"

부정 측이 좀 더 많았는데 핵심은 이거다.

"thinking token만 쓰고 결과 설명 안 함", "루프에 빠짐", "원치 않는 리팩터링 멈추지 않음"

Gemini로 계획 짜고 Claude로 실행하는 전략 쓰다가 결국 Claude만 쓰게 됐다는 사람도 많았다.

공식에선 이번에 웹 프로그래밍 기능이나, 동영상 기능이 상향됐다는데
코딩 기능 이외에 주요 타겟팅이 그쪽으로도 가 있어서 약간 불완전하게 상승했나보다.

마무리

일단 지금도 Antigravity로 작업하고 있으니,
Antigravity로 초안이나 큰 코드 계획을 짜고 claude로 구현하는 것이 주가 될 것 같다.

그래서 지금 당장 갈아탄다는 생각은 없고,
단순 개별 스크립트나 데이터 파싱 쪽에서는 이전처럼 써볼 것 같다.

SWE-Bench 80.6%가 사실이라면 agentic 코딩도 이전보다는 나아졌을 테니 직접 써보고 파악해야 할 것 같다.
일단 백업을 확실하게 해두자

요약

  • ARC-AGI-2 77.1%로 3 Pro 대비 2배 이상
  • 가격은 Opus 4.6 대비 60% 수준
  • agentic 정밀도 / 코드 간섭 문제는 커뮤니티 반응상 여전히 논란
  • 현재 프리뷰 상태이며, 지속적으로 테스트해볼 예정

참고: Google The Keyword 공식 포스트, HackerNews 유저 반응, GeekNews 포스팅

0개의 댓글