

안녕하세요, 미니지식공간입니다.
gpt-live-1이 2026년 9월 10일 OpenAI API에 올라왔다. 음성 레이어만 분당 0.05달러로 과금되고 추론은 뒤에 붙인 백엔드 모델이 맡는 구조라, Realtime API를 쓰던 코드와 세션 설정부터 이벤트 처리까지 꽤 달라진다. 공식 문서 기준으로 세션 만드는 법, 딜리게이션(delegation, 백엔드 위임) 두 가지 모드, 요금 계산을 정리한다.
GPT-Live는 두 덩어리로 나뉜다.
풀 듀플렉스(full duplex)라 말하는 도중에도 듣는다. 위임한 작업이 도는 동안 대화는 끊기지 않는다. 중요한 함정 하나: 사용자가 말을 끊었다고 해서 백엔드 작업이 자동 취소되지는 않는다. 취소·권한·확인 절차는 애플리케이션이 직접 관리해야 한다.
Realtime API는 음성·추론·툴 선택을 한 모델이 다 했지만, Live는 음성 모델과 백엔드 모델을 따로 고른다. 이 차이가 요금과 코드 양쪽에 그대로 반영된다.
백엔드를 OpenAI가 관리해 주는 쪽이 Responses 딜리게이션이다. 세션 생성 시점에 백엔드 모델을 지정한다.
from openai.types.live.session_config_param import SessionConfigParam
session: SessionConfigParam = {
"model": "gpt-live-1",
"delegation": {
"type": "responses",
"responses": {
"model": "gpt-5.6-terra",
"instructions": "[Your backend prompt]",
},
},
}
출처: Delegation and tools in GPT-Live
문서는 GPT-5.6 Terra로 시작하고, 비용이 민감한 워크로드에는 GPT-5.6 Luna를 시험해 보라고 안내한다. 툴은 delegation.responses.tools에 등록하고 tool_choice로 auto / required / none 또는 특정 함수명을 지정한다. parallel_tool_calls를 true로 두면 독립적인 조회를 동시에 돌릴 수 있다.
지연에 민감한 호출이라면 delegation.responses.service_tier를 "priority"로 둬서 Fast mode를 쓸 수 있다(모델·프로젝트 지원 여부에 따라 다름). 대화 중간에 백엔드 모델이나 툴을 바꾸고 싶으면 session.update로 session.delegation.responses 하위 값만 갱신하면 된다. 단, delegation을 null로 바꿔 클라이언트 모드로 전환하는 것은 실패한다(immutable_field_update). 모드 변경은 새 세션이 필요하다.
백엔드 실행을 직접 통제하려면 클라이언트 모드를 쓴다. 세션 설정은 훨씬 단순하다.
from openai.types.live.session_config_param import SessionConfigParam
session: SessionConfigParam = {"model": "gpt-live-1", "delegation": {"type": "client"}}
대신 대화 컨텍스트를 애플리케이션이 직접 들고 있어야 한다. session.input_transcript.delta와 session.output_transcript.delta를 받아 기록해 두지 않으면 "네", "금요일 말고 목요일" 같은 짧은 정정을 해석할 수 없다. session.delegation.created 이벤트에는 delegation.id와 target 같은 메타데이터만 들어 있고 사용자의 발화 내용은 들어 있지 않다.
작업이 끝나면 그 ID로 결과를 돌려준다.
from openai.resources.live.live import AsyncLiveConnection
from openai.resources.live.sideband import AsyncSidebandConnection
async def send_update(
connection: AsyncLiveConnection | AsyncSidebandConnection,
) -> None:
await connection.session.commentary.append(
event_id="appointment_result",
delegation_id="item_123",
content="Your appointment is confirmed for Thursday at 2:00 PM",
)
출처: Delegation and tools in GPT-Live
append 계열 이벤트는 세 가지로 나뉜다. 전부 평문 문자열이고 append당 500토큰 제한이 있다.
| 보내려는 내용 | 이벤트 |
|---|---|
| 라이브 모델의 행동을 바꾸는 시스템 지시 | session.instructions.append |
| 소리 내지 않고 내부 추론에만 쓸 정보 | session.thinking.append |
| 모델이 말로 전달해야 할 결과 | session.commentary.append |
주의할 점은 acknowledgment의 의미다. session.commentary.appended가 왔다는 것은 컨텍스트가 주입됐다는 뜻이지, 모델이 그 내용을 실제로 말했다는 보장이 아니다. 예약이 확정됐다고 말하기 전에 예약이 정말 성공했는지 애플리케이션 상태로 먼저 확인해야 한다.

| 항목 | 값 |
|---|---|
| 모델 ID | gpt-live-1 |
| 엔드포인트 | v1/live/sessions |
| 입출력 모달리티 | 오디오·텍스트 입출력, 이미지·비디오 미지원 |
| 스트리밍 / 함수 호출 | 지원 |
| Structured outputs / 파인튜닝 | 미지원 |
| 동시 세션 한도 | Tier 1 25 / Tier 2 50 / Tier 3 200 / Tier 4 300 / Tier 5 500, 무료 티어 미지원 |
| 지식 컷오프 | 2025년 7월 31일 |
| 연결 방식 | WebRTC, WebSocket, 서버 사이드 컨트롤(사이드밴드), 텔레포니·SIP |
이미지 입력이 빠진 점은 짚고 넘어갈 만하다. 전작 GPT-Realtime-2.1은 이미지 입력을 지원했다. 통화 중 사진을 해석해야 한다면 이미지를 비전 지원 백엔드로 따로 보내고 결과 텍스트만 Live에 돌려주는 경로를 짜야 한다. Live 오디오 프런트엔드는 이미지를 직접 받지 않는다.
음성 세션은 분당 0.05달러, 초 단위로 과금된다. 30초 통화는 0.025달러이고 분 단위로 올림하지 않는다. 백엔드 Responses 호출은 해당 모델과 툴의 정상 요금이 따로 붙는다.
전작과 비교하면 과금 축 자체가 바뀌었다. GPT-Realtime-2.1은 오디오 입력 100만 토큰당 32달러, 출력 100만 토큰당 64달러였다. 이제는 음성에 대해 통화 시간으로 내고, 토큰 청구는 백엔드 모델로 옮겨 간다. 어느 쪽이 싼지는 백엔드 선택에 달렸고, OpenAI는 완성된 에이전트의 통화당 비용 예시를 제시하지 않았다.
성능 수치도 같은 기준으로 읽어야 한다. Full Duplex Bench에서 GPT-Realtime-2.1 대비 30%p 향상, GPT-6 Astra(medium 추론 강도) 조합 시 Tau3 1위는 모두 OpenAI 자사 평가다. 두 모델의 절대 점수는 공개되지 않았고, Tau3 1위는 특정 백엔드 조합의 성적이라 저렴한 모델을 붙이면 그대로 따라오지 않는다. 밀리초 단위 지연 수치는 공식 발표와 모델 페이지 어디에도 없어 확인 필요 상태다.
음성 모델 요금 구조가 어떻게 바뀌어 왔는지는 전작을 정리한 gpt-realtime-2.1-mini로 저비용 음성 에이전트 구축 글과 함께 보면 비교가 쉽다.
Q. gpt-live-1은 분당 0.05달러만 내면 되나?
아니다. 0.05달러는 음성 레이어만 해당하고 초 단위로 과금된다. 백엔드 모델의 토큰 비용과 툴 사용료는 별도 청구다. 총비용은 백엔드 선택에 따라 크게 달라진다.
Q. 세션 도중에 딜리게이션 모드를 바꿀 수 있나?
없다. 모드는 세션 생성 시점에 결정된다. 실행 중인 Responses 세션에서 delegation을 null로 바꾸면 immutable_field_update로 실패한다. 백엔드 모델이나 툴 같은 하위 설정은 session.update로 바꿀 수 있다.
Q. Realtime API에서 옮기면 이미지 기능은 어떻게 되나?
gpt-live-1은 이미지와 비디오 입력을 지원하지 않는다. 이미지는 비전 지원 백엔드로 보내고 해석 결과 텍스트만 Live 대화에 돌려주는 구조로 바꿔야 한다. 복귀 일정은 공개되지 않았다.
이번 릴리스의 실질적 가치는 벤치마크보다 삭제되는 코드에 있다. 끼어들기 처리와 STT–LLM–TTS 핸드오프를 직접 관리하던 팀이라면 그 계층이 통째로 사라진다. 대신 백엔드 선택이라는 결정이 남고, 그 결정에 대한 비용 가이드는 아직 제공되지 않는다. 도입 전 자기 시나리오에서 통화당 비용과 작업 성공률을 직접 측정해 보시길 권합니다.
본 글은 공개 자료를 바탕으로 정리했으며, 세부 내용·수치는 원 출처·공식 문서와 대조 확인을 권장합니다.