solar-mini4 API 전환 가이드 — 512K 컨텍스트에 solar-pro4의 3분의 1 단가

mini_knows·7일 전

AI 트렌드·이슈

목록 보기
113/119

안녕하세요, 미니지식공간입니다.

업스테이지의 경량 모델 solar-mini4 정식 API가 열렸다. solar-mini4는 상위 모델 solar-pro4와 컨텍스트 창(512K)·최대 출력(128K)·지원 기능이 같은데 토큰 단가만 정확히 3분의 1이라, "프로 4를 쓰던 호출을 그대로 미니로 내려도 되는가"가 이번 릴리스의 실질 질문이다.

TL;DR

  • 공식 문서 기준 solar-mini4-260922 공개일은 2026년 9월 22일. 별칭은 solar-mini4.
  • 35B 총 파라미터 / 토큰당 활성 3B. 512K 컨텍스트, 128K 출력, 학습 컷오프 2026년 2월.
  • 단가는 100만 토큰당 입력 $0.10 / 출력 $0.40 / 캐시 $0.01. solar-pro4($0.30 / $1.20 / $0.06)의 1/3, 캐시는 1/6.

1. 별칭과 버전

업스테이지는 버전 고정 이름과 별칭을 따로 둔다. 퀵스타트 문서의 별칭 표를 그대로 옮기면 다음과 같다.

Alias            Currently points to    RPM / TPM
solar-pro4       solar-pro4-260806      100 / 250,000
solar-mini4      solar-mini4-260922     100 / 250,000
solar-pro3       solar-pro3-260323      100 / 250,000
solar-pro2       solar-pro2-251215      100 / 250,000
solar-mini       solar-mini-250422      100 / 50,000
syn-pro          syn-pro-251021         100 / 50,000

출처: https://console.upstage.ai/docs/capabilities/generate/chat

문서는 별칭 사용을 권장하면서 동시에 경고를 붙인다. 별칭이 갱신되면 코드를 고치지 않아도 되지만, 프롬프트 처리 방식이나 출력 구조가 조금 달라질 수 있으니 운영 환경에서는 핵심 프롬프트와 응답을 검증하라는 내용이다. 재현성이 중요한 배치 작업이라면 solar-mini4-260922처럼 버전을 박아 두는 쪽이 안전하다.

2. 최소 호출

Solar API는 OpenAI API 호환이고 base URL은 https://api.upstage.ai/v1이다. 아래는 공식 퀵스타트 문서의 Python 예제에서 모델 문자열만 solar-mini4로 바꾼 것이다(예제 구조·필드는 문서 원문 그대로).

from openai import OpenAI

client = OpenAI(
    api_key="UPSTAGE_API_KEY",
    base_url="https://api.upstage.ai/v1"
)

response = client.chat.completions.create(
    model="solar-mini4",
    messages=[
        {
            "role": "user",
            "content": "Hi, how are you?"
        }
    ]
)

print(response.choices[0].message.content)

출처: https://console.upstage.ai/docs/capabilities/generate/chat

응답의 model 필드에는 별칭이 아니라 실제 처리한 버전(solar-mini4-260922 형태)이 담긴다. 별칭을 쓰는 경우 로그에 이 값을 같이 남겨 두면 나중에 "언제부터 모델이 바뀌었나"를 추적할 수 있다. usage.prompt_tokens_details.cached_tokens에 캐시 적중 토큰 수가, usage.completion_tokens_details.reasoning_tokens에 추론에 쓴 토큰 수가 들어온다.

3. reasoning_effort는 기본이 꺼짐이다

solar-mini4는 solar-pro4와 같은 규칙을 따른다. 공식 문서의 표를 그대로 옮기면 이렇다.

모델생략 시추론 끄는 값추론 켜는 값message.reasoning 노출
solar-pro4OFFnone, minimallow, medium, high, xhigh, max노출
solar-mini4OFFnone, minimallow, medium, high, xhigh, max노출
solar-pro3OFFminimal, lowmedium, high노출
solar-pro2OFFminimal, lowmedium, high비노출
solar-mini표준 채팅미지원미지원비노출

출처: https://console.upstage.ai/docs/capabilities/generate/reasoning

여기서 실무상 중요한 포인트가 세 가지다. 첫째, reasoning_effort를 생략하거나 null로 보내면 추론은 꺼진 채로 동작한다. 둘째, 구형 solar-mini는 이 파라미터 자체를 받지 않아 어떤 값이든 보내면 HTTP 400이 떨어진다. 셋째, 추론 토큰은 출력(completion) 토큰에 합산되므로 max_tokens를 좁게 잡으면 추론만 하다 예산을 다 쓰고 content가 null, finish_reason이 length로 돌아온다.

추론을 켜는 호출은 공식 문서 예제 기준으로 다음과 같다(모델 문자열만 교체).

from openai import OpenAI

client = OpenAI(
    api_key="UPSTAGE_API_KEY",
    base_url="https://api.upstage.ai/v1"
)

response = client.chat.completions.create(
    model="solar-mini4",
    messages=[
        {
            "role": "user",
            "content": "An $80 item gets a 20% discount, then 10% tax is added. What is the final price? Answer with only the dollar amount."
        }
    ],
    reasoning_effort="medium"
)

message = response.choices[0].message

reasoning = getattr(message, "reasoning", None)
if reasoning:
    print(reasoning)

print(message.content)

출처: https://console.upstage.ai/docs/capabilities/generate/reasoning

스트리밍에서는 추론 트레이스가 delta.reasoning으로 먼저 오고 답변이 delta.content로 뒤따른다. 문서는 추론 트레이스에 사용자 입력이나 민감한 중간값이 섞일 수 있으니 운영 로그에 기본 적재하지 말라고 명시한다.

4. 단가 구조

항목(100만 토큰당)solar-mini4solar-pro4배수
입력$0.10$0.301/3
출력$0.40$1.201/3
캐시 입력$0.01$0.061/6
컨텍스트 / 최대 출력512K / 128K512K / 128K동일
공개일2026-09-222026-08-06-

출처: 업스테이지 공식 모델 문서 2종(하단 출처 참조)

캐시 배수가 눈에 띈다. mini4의 캐시 입력은 기본 입력의 10분의 1인데 pro4는 5분의 1이다. 시스템 프롬프트와 툴 정의가 긴 에이전트처럼 프리필이 매 호출 반복되는 구조에서는 이 차이가 단가 차이보다 크게 작용한다.

여기에 한시 할인이 있다. 공식 문서 상단 배너는 Solar Mini 4 is live. 50% off through Oct 22 (UTC)로 안내하고, OpenRouter의 solar-mini4 페이지도 입력 $0.05 / 출력 $0.20을 싣고 있어 정가의 절반이다. 원가 산정은 할인가가 아니라 정가 기준으로 잡아두는 편이 안전하다.

5. 512K 창과 분당 토큰 한도

퀵스타트 문서에 표기된 solar-mini4의 한도는 100 RPM / 250,000 TPM이다. 컨텍스트 창이 512K인데 표기 TPM은 25만이므로, 창을 가득 채운 요청 한 건은 표기 한도만으로는 분당 토큰 예산을 넘는다. 레이트리밋 문서는 한도가 커밋먼트 티어에 따라 자동 배정되며 크레딧 구매로 상향된다고 설명하므로, 장문 처리를 전제한다면 티어별 실제 TPM을 먼저 확인해야 한다.

한도 초과 시 응답은 HTTP 429이고, 모든 응답에 남은 허용량이 헤더로 실린다. 문서에 실린 헤더 확인 예제는 다음과 같다(model 값은 문서 원문이 solar-pro로 되어 있으니 실제로는 사용하는 모델로 바꿔야 한다).

# Check only response headers
curl -s -D - -o /dev/null \
  -H "Authorization: Bearer $UPSTAGE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model": "solar-pro", "messages": [{"role": "user", "content": "Hello"}]}' \
  https://api.upstage.ai/v1/solar/chat/completions \
  | grep -i "X-Upstage-RateLimit"

출처: https://console.upstage.ai/docs/guides/rate-limits

돌아오는 헤더는 X-Upstage-RateLimit-Limit-Tokens, -Remaining-Tokens, -Reset-Tokens, -Interval-Tokens 조합이다. 429일 때만 X-Upstage-RateLimit-Retry-After-*가 붙고, 초과한 카테고리에만 붙는다. Remaining 값은 음수가 될 수 있으며 이는 초과량을 뜻한다.

6. 제3자 평가 수치

업스테이지는 mini4가 pro4의 7분의 1 크기로 비슷한 성능을 낸다고 설명했지만 이는 자사 주장이다. 독립 측정치는 현재 한 건 확인된다. 서강대 수학과 김종락 교수 연구팀이 자체 플랫폼 '앤트로피매스'로 수능 수학 46문항을 툴증강추론(TAR) 방식으로 평가한 결과가 2026년 9월 18일 공개됐다. 대상은 정식 버전이 아니라 프리뷰 버전이다.

지표Solar Mini 4 프리뷰비교군
Pass@393.5%-
ACC(1회 정답률)76.8%solar-pro4 87.7% / 딥시크·뮤즈 100%
평균 소요 시간14.9초딥시크-V4.1 플래시 18.6초, 뮤즈 스파크 1.3 24.1초, solar-pro4 120.5초
중앙값 소요 시간4.5초비교군 중 최단
파이썬 호출·실행 성공138회 중 128회정답+실행 동시 충족 99회
도구 활용 지표solar-pro4 대비 +8.7%p-

출처: AI타임스 2026-09-18 보도

해석에 주의가 필요하다. 연구팀은 mini만 업스테이지 API로, 나머지는 OpenRouter를 경유해 호출했기 때문에 접근 경로와 측정 시점의 인프라 차이가 결과에 영향을 줄 수 있고, 모델별 대상 문항이 달라 평균 소요 시간을 순수 속도 차이로 단정하기 어렵다고 밝혔다. 과목별로는 기하가 54.2%로 가장 낮았고, 복잡한 기하 조건을 수식으로 변환하는 능력에 개선이 필요하다는 평가가 함께 나왔다.

한편 AI타임스는 solar-pro4를 250B로 적었으나 업스테이지 공식 문서는 pro4의 파라미터를 공개하지 않는다(확인 필요). 공개일도 공식 문서는 2026-09-22, OpenRouter는 2026-09-23으로 달라 이 글은 1차 출처를 따랐다.

7. 전환 전 점검 5가지

  1. 입출력 비율부터 재기. 출력 단가가 입력의 4배다. 입력이 길고 출력이 짧은 요약·추출형 작업일수록 mini4 전환 효과가 크고, 장문 생성 작업은 효과가 줄어든다.
  2. 캐시 적중률 확인. usage.prompt_tokens_details.cached_tokens를 로깅해 프리필이 실제로 캐시를 타는지 본다. 캐시가 안 타면 1/6 단가는 종이 위의 숫자다.
  3. reasoning_effort 분기 정리. 구형 solar-mini에서 올라온다면 이 파라미터 분기 자체가 없었을 가능성이 높다. mini4는 생략 시 추론 OFF이므로, 정확도가 필요한 경로만 골라 켠다.
  4. max_tokens 여유 확보. 추론 토큰이 출력 토큰을 잡아먹어 content가 null, finish_reason이 length로 끝나는 케이스를 회귀 테스트에 넣는다.
  5. 티어별 TPM 확인. 512K 창을 실제로 쓸 계획이면 표기 한도(250,000 TPM)로는 부족하다. 레이트리밋 문서의 티어 표와 응답 헤더로 실제 허용량을 먼저 확인한다.

자주 묻는 질문

Q. solar-mini4로 바꿀 때 기존 API 코드를 고쳐야 하나?
base URL(https://api.upstage.ai/v1)과 OpenAI 호환 인터페이스는 그대로라 모델 문자열 교체가 기본이다. 단, 구형 solar-mini에서 올라오는 경우 추론 파라미터 분기와 컨텍스트 전제(32K → 512K)를 다시 봐야 한다.

Q. Solar Mini 4 가격이 앞으로 오르나?
정가는 100만 토큰당 입력 $0.10 / 출력 $0.40이고, 공식 배너 기준 2026년 10월 22일(UTC)까지 50% 할인이 적용된다. 할인 종료 이후 정가 적용 여부에 대한 별도 공지는 확인되지 않았다(확인 필요).

Q. solar-mini4와 solar-pro4는 어떤 기준으로 나누나?
스펙상 컨텍스트·출력·기능·언어가 같고 단가만 3배 차이다. 1회 정답률이 중요한 경로는 pro4, 빠른 응답과 도구 호출 반복이 중요한 에이전트 경로는 mini4가 후보다. 제3자 평가에서도 그 방향으로 갈렸다.

마무리

같은 창, 3분의 1 단가라는 구도는 라우팅 설계를 다시 보게 만든다. 모델 ID만 바꿔 끼우는 전환이 어떤 부작용을 남기는지는 kimi-for-coding이 K2.8 Preview로 인플레이스 교체된 사례에서 이미 한 번 정리한 적이 있고, 단가만 보고 모델을 고르기 전에 캐시 요율까지 같이 봐야 한다는 점은 GPT-6 Sol과 Claude Opus 5.5 단가 비교에서 다룬 내용과 같은 맥락이다. 직접 재보시고 판단하시길 권합니다. 읽어주셔서 감사합니다.

출처

본 글은 공개 자료를 바탕으로 정리했으며, 세부 내용·수치는 원 출처·공식 문서와 대조 확인을 권장합니다. 크기·성능에 관한 업스테이지의 설명은 자사 발표이며, 서강대 연구팀 평가는 프리뷰 버전을 대상으로 한 제3자 측정 결과입니다. 가격과 할인 기간은 2026년 9월 26일 확인 기준입니다.

profile
작지만 알아야 할 모든 것

0개의 댓글