gpt-live-1 API 뜯어보기 — full-duplex 세션, 딜리게이션 설정, 요금 계산

mini_knows·2026년 9월 14일

AI 트렌드·이슈

목록 보기
101/123
post-thumbnail

안녕하세요, 미니지식공간입니다.

gpt-live-1이 2026년 9월 10일 OpenAI API에 올라왔다. 음성 레이어만 분당 0.05달러로 과금되고 추론은 뒤에 붙인 백엔드 모델이 맡는 구조라, Realtime API를 쓰던 코드와 세션 설정부터 이벤트 처리까지 꽤 달라진다. 공식 문서 기준으로 세션 만드는 법, 딜리게이션(delegation, 백엔드 위임) 두 가지 모드, 요금 계산을 정리한다.

1. 구조부터 나눠 보기

GPT-Live는 두 덩어리로 나뉜다.

  • 프런트(GPT-Live-1) — 듣고, 말하고, 언제 백엔드에 도움을 요청할지 판단한다. 프롬프트는 대화 스타일과 위임 시점만 짧게 준다.
  • 백엔드 — 위임받은 작업의 추론과 툴 호출을 맡는다. 상세 업무 규칙과 툴 워크플로는 전부 여기에 둔다.

풀 듀플렉스(full duplex)라 말하는 도중에도 듣는다. 위임한 작업이 도는 동안 대화는 끊기지 않는다. 중요한 함정 하나: 사용자가 말을 끊었다고 해서 백엔드 작업이 자동 취소되지는 않는다. 취소·권한·확인 절차는 애플리케이션이 직접 관리해야 한다.

Realtime API는 음성·추론·툴 선택을 한 모델이 다 했지만, Live는 음성 모델과 백엔드 모델을 따로 고른다. 이 차이가 요금과 코드 양쪽에 그대로 반영된다.

2. Responses 딜리게이션으로 세션 만들기

백엔드를 OpenAI가 관리해 주는 쪽이 Responses 딜리게이션이다. 세션 생성 시점에 백엔드 모델을 지정한다.

from openai.types.live.session_config_param import SessionConfigParam

session: SessionConfigParam = {
    "model": "gpt-live-1",
    "delegation": {
        "type": "responses",
        "responses": {
            "model": "gpt-5.6-terra",
            "instructions": "[Your backend prompt]",
        },
    },
}

출처: Delegation and tools in GPT-Live

문서는 GPT-5.6 Terra로 시작하고, 비용이 민감한 워크로드에는 GPT-5.6 Luna를 시험해 보라고 안내한다. 툴은 delegation.responses.tools에 등록하고 tool_choice로 auto / required / none 또는 특정 함수명을 지정한다. parallel_tool_calls를 true로 두면 독립적인 조회를 동시에 돌릴 수 있다.

지연에 민감한 호출이라면 delegation.responses.service_tier를 "priority"로 둬서 Fast mode를 쓸 수 있다(모델·프로젝트 지원 여부에 따라 다름). 대화 중간에 백엔드 모델이나 툴을 바꾸고 싶으면 session.update로 session.delegation.responses 하위 값만 갱신하면 된다. 단, delegation을 null로 바꿔 클라이언트 모드로 전환하는 것은 실패한다(immutable_field_update). 모드 변경은 새 세션이 필요하다.

3. 클라이언트 딜리게이션에서 결과 돌려주기

백엔드 실행을 직접 통제하려면 클라이언트 모드를 쓴다. 세션 설정은 훨씬 단순하다.

from openai.types.live.session_config_param import SessionConfigParam

session: SessionConfigParam = {"model": "gpt-live-1", "delegation": {"type": "client"}}

대신 대화 컨텍스트를 애플리케이션이 직접 들고 있어야 한다. session.input_transcript.delta와 session.output_transcript.delta를 받아 기록해 두지 않으면 "네", "금요일 말고 목요일" 같은 짧은 정정을 해석할 수 없다. session.delegation.created 이벤트에는 delegation.id와 target 같은 메타데이터만 들어 있고 사용자의 발화 내용은 들어 있지 않다.

작업이 끝나면 그 ID로 결과를 돌려준다.

from openai.resources.live.live import AsyncLiveConnection
from openai.resources.live.sideband import AsyncSidebandConnection


async def send_update(
    connection: AsyncLiveConnection | AsyncSidebandConnection,
) -> None:
    await connection.session.commentary.append(
        event_id="appointment_result",
        delegation_id="item_123",
        content="Your appointment is confirmed for Thursday at 2:00 PM",
    )

출처: Delegation and tools in GPT-Live

append 계열 이벤트는 세 가지로 나뉜다. 전부 평문 문자열이고 append당 500토큰 제한이 있다.

보내려는 내용이벤트
라이브 모델의 행동을 바꾸는 시스템 지시session.instructions.append
소리 내지 않고 내부 추론에만 쓸 정보session.thinking.append
모델이 말로 전달해야 할 결과session.commentary.append

주의할 점은 acknowledgment의 의미다. session.commentary.appended가 왔다는 것은 컨텍스트가 주입됐다는 뜻이지, 모델이 그 내용을 실제로 말했다는 보장이 아니다. 예약이 확정됐다고 말하기 전에 예약이 정말 성공했는지 애플리케이션 상태로 먼저 확인해야 한다.

4. 스펙 표

항목값
모델 IDgpt-live-1
엔드포인트v1/live/sessions
입출력 모달리티오디오·텍스트 입출력, 이미지·비디오 미지원
스트리밍 / 함수 호출지원
Structured outputs / 파인튜닝미지원
동시 세션 한도Tier 1 25 / Tier 2 50 / Tier 3 200 / Tier 4 300 / Tier 5 500, 무료 티어 미지원
지식 컷오프2025년 7월 31일
연결 방식WebRTC, WebSocket, 서버 사이드 컨트롤(사이드밴드), 텔레포니·SIP

이미지 입력이 빠진 점은 짚고 넘어갈 만하다. 전작 GPT-Realtime-2.1은 이미지 입력을 지원했다. 통화 중 사진을 해석해야 한다면 이미지를 비전 지원 백엔드로 따로 보내고 결과 텍스트만 Live에 돌려주는 경로를 짜야 한다. Live 오디오 프런트엔드는 이미지를 직접 받지 않는다.

5. 요금 계산

음성 세션은 분당 0.05달러, 초 단위로 과금된다. 30초 통화는 0.025달러이고 분 단위로 올림하지 않는다. 백엔드 Responses 호출은 해당 모델과 툴의 정상 요금이 따로 붙는다.

전작과 비교하면 과금 축 자체가 바뀌었다. GPT-Realtime-2.1은 오디오 입력 100만 토큰당 32달러, 출력 100만 토큰당 64달러였다. 이제는 음성에 대해 통화 시간으로 내고, 토큰 청구는 백엔드 모델로 옮겨 간다. 어느 쪽이 싼지는 백엔드 선택에 달렸고, OpenAI는 완성된 에이전트의 통화당 비용 예시를 제시하지 않았다.

성능 수치도 같은 기준으로 읽어야 한다. Full Duplex Bench에서 GPT-Realtime-2.1 대비 30%p 향상, GPT-6 Astra(medium 추론 강도) 조합 시 Tau3 1위는 모두 OpenAI 자사 평가다. 두 모델의 절대 점수는 공개되지 않았고, Tau3 1위는 특정 백엔드 조합의 성적이라 저렴한 모델을 붙이면 그대로 따라오지 않는다. 밀리초 단위 지연 수치는 공식 발표와 모델 페이지 어디에도 없어 확인 필요 상태다.

6. 마이그레이션 체크리스트

  • 백엔드 모델을 무엇으로 둘지 먼저 정한다. 통화당 비용과 성공률은 여기서 갈린다.
  • 트랜스크립트 보관 로직이 있는지 확인한다. 클라이언트 딜리게이션은 필수다.
  • 끼어들기 시 백엔드 작업 취소 정책을 명시적으로 짠다. 자동 취소는 없다.
  • 재시도 전에 원래 동작이 이미 실행됐는지 확인한다. 응답 유실이 이중 예약으로 이어지면 안 된다.
  • 이미지 입력이 필요한 경로가 있는지 점검한다.

음성 모델 요금 구조가 어떻게 바뀌어 왔는지는 전작을 정리한 gpt-realtime-2.1-mini로 저비용 음성 에이전트 구축 글과 함께 보면 비교가 쉽다.

자주 묻는 질문

Q. gpt-live-1은 분당 0.05달러만 내면 되나?
아니다. 0.05달러는 음성 레이어만 해당하고 초 단위로 과금된다. 백엔드 모델의 토큰 비용과 툴 사용료는 별도 청구다. 총비용은 백엔드 선택에 따라 크게 달라진다.

Q. 세션 도중에 딜리게이션 모드를 바꿀 수 있나?
없다. 모드는 세션 생성 시점에 결정된다. 실행 중인 Responses 세션에서 delegation을 null로 바꾸면 immutable_field_update로 실패한다. 백엔드 모델이나 툴 같은 하위 설정은 session.update로 바꿀 수 있다.

Q. Realtime API에서 옮기면 이미지 기능은 어떻게 되나?
gpt-live-1은 이미지와 비디오 입력을 지원하지 않는다. 이미지는 비전 지원 백엔드로 보내고 해석 결과 텍스트만 Live 대화에 돌려주는 구조로 바꿔야 한다. 복귀 일정은 공개되지 않았다.

마무리

이번 릴리스의 실질적 가치는 벤치마크보다 삭제되는 코드에 있다. 끼어들기 처리와 STT–LLM–TTS 핸드오프를 직접 관리하던 팀이라면 그 계층이 통째로 사라진다. 대신 백엔드 선택이라는 결정이 남고, 그 결정에 대한 비용 가이드는 아직 제공되지 않는다. 도입 전 자기 시나리오에서 통화당 비용과 작업 성공률을 직접 측정해 보시길 권합니다.

출처

본 글은 공개 자료를 바탕으로 정리했으며, 세부 내용·수치는 원 출처·공식 문서와 대조 확인을 권장합니다.

profile
작지만 알아야 할 모든 것

0개의 댓글