Claude 블로그 되짚어보기 #88 — Web Search Dynamic Filtering, AI as Researcher (2026)

panicdev·2026년 5월 3일

원문 정보

글의 요지

Web Search Dynamic Filtering 출시. Claude가 검색 결과 처리 시 코드 작성·실행으로 컨텍스트 윈도우 진입 전 필터링. +11% 정확도 (BrowseComp, DeepsearchQA 평균), -24% 입력 토큰. "raw HTML 추론" X, "Python 작성해 파싱·필터·크로스 참조" O.

문제 — Web Search의 토큰 낭비

본문 인용:

"Web search is a highly token-intensive task. Agents using basic web search tools need to make a query, pull search results into context, fetch full HTML files from multiple websites, and reason over it all before responding. But the context being pulled in from search is often irrelevant, which degrades the quality of the response."

(웹 검색 = 토큰 매우 많이. 전체 HTML 가져옴, 컨텍스트에 넣고 추론. 그러나 무관 콘텐츠 다수 → 품질 저하)

전통 흐름:

Query → Fetch full HTML → Load context → Reason

문제:

  • Navigation menu, scripts, ads = 컨텍스트 차지
  • 무관 정보 = 답변 정확도 저하
  • 토큰 비용 ↑

새 접근 — Dynamic Filtering

본문 강조:

"Instead of reasoning over full HTML files, Claude can dynamically filter the search results before loading them into context, keeping only what's relevant and discarding the rest."

(전체 HTML 추론 X, 동적으로 결과 필터링 후 컨텍스트 로드)

흐름:

Query → Fetch → Claude writes Python code →
Execute filter → Load filtered → Reason

작동:

  • Claude가 Python 작성 (자동)
  • 코드 실행 (sandbox)
  • 관련 부분만 추출
  • 컨텍스트로 로드

벤치마크 결과

BrowseComp (hard-to-find 정보 찾기)

모델이전Dynamic Filtering
Sonnet 4.633.3%46.6% (+13.3pp)
Opus 4.645.3%61.6% (+16.3pp)

DeepsearchQA (multi-answer 검색, F1)

모델이전Dynamic Filtering
Sonnet 4.652.6%59.4% (+6.8pp)
Opus 4.669.8%77.3% (+7.5pp)

평균 +11% 정확도 개선 + -24% 토큰.

사용 — API

web_search_20260209 tool version:

client = anthropic.Anthropic()
response = client.messages.create(
    model="claude-opus-4-7",
    max_tokens=4096,
    messages=[{
        "role": "user",
        "content": "Search for current AAPL and GOOGL prices, calculate P/E."
    }],
    tools=[{
        "type": "web_search_20260209",
        "name": "web_search"
    }],
)

지원 모델:

  • Claude Mythos Preview
  • Claude Opus 4.7
  • Claude Opus 4.6
  • Claude Sonnet 4.6

Quora Poe 사례

Gareth Jones (Quora Product/Research Lead):

"Opus 4.6 with dynamic filtering achieved the highest accuracy on our internal evals when tested against other frontier models."

"The model behaves like an actual researcher, writing Python to parse, filter, and cross-reference results rather than reasoning over raw HTML in context."

(Opus 4.6 + dynamic filtering = 다른 frontier 모델 중 최고 정확도. 모델이 실제 연구자처럼 행동)

비용 디테일

  • Sonnet 4.6: 토큰 ↓ + 비용 ↓
  • Opus 4.6: 토큰 ↓ but 때때로 비용 ↑ (더 복잡 필터 코드)
  • Anthropic 권장: 자기 query에 벤치마크

2026년에 다시 읽으며 — 내가 본 것

1. "Code Execution = New Context Engineering" 패러다임

이 글의 가장 중요한 통찰 — 컨텍스트 엔지니어링의 새 패러다임.

이전 패러다임:

  • 컨텍스트 = static text
  • LLM이 직접 추론
  • 토큰 낭비

새 패러다임:

  • 컨텍스트 = 코드 처리 후
  • LLM이 코드 작성·실행
  • 효율 + 정확도

이게 "AI가 자기 데이터 처리" 의 정석:

  • 인간 패턴: 데이터 보고 → 처리 → 결론
  • AI 패턴: 데이터 보고 → 코드 작성 → 실행 → 결론

비유:

  • 분석가: 데이터 dump → Excel 열기 → 필터 → 분석
  • AI Without filtering: 모든 데이터 직접 추론
  • AI With filtering: 코드로 필터 → 깨끗한 데이터 추론

후자가 분석가 패턴과 같다. AI = 분석가 행동.

2. "BrowseComp 61.6% vs 45.3%" 의 정량 증명

가장 충격적 수치 — Opus 4.6 BrowseComp 45.3% → 61.6%.

이 16.3pp 증가의 의미:

  • "hard-to-find 정보" 찾기 작업
  • 16% 더 많은 답 발견
  • 거의 1.4× 성능

이게 실제 use case에서:

  • 리서치 어시스턴트
  • 인용 검증
  • 경쟁 정보 수집
  • "agent급 검색"

비교 — 기존 검색 엔진:

  • Google: 단일 키워드 → 결과 list
  • 사람이 click → click → click
  • 시간 + 인지 부담

Dynamic filtering 검색:

  • 자연어 query
  • AI가 multi-step 검색
  • AI가 필터·크로스 참조
  • 반환

"AI = 검색 엔진 위 layer" 가 검색 산업의 새 동학이다.

3. "코드 실행으로 컨텍스트 처리" 의 일반 원칙

본문 (Gend.co 인용):

"Dynamic filtering is part of a wider shift: keep large, messy intermediate artefacts out of the model's context window, and only pass through what's needed to answer the user."

이 원칙이 모든 AI 시스템에 일반화:

  • Skills (#74): 컨텍스트 효율
  • Code execution: 데이터 처리
  • MCP: 도구 추상화
  • 공통: context window를 깨끗이

이게 "context engineering" 의 핵심 원칙. #75 글의 "Load-bearing skill of 2026".

비교 — 인지 과학:

  • 인간 working memory = 7±2 items
  • 정보 너무 많음 = 결정 저하
  • AI도 같음

Anthropic 디자인 철학:

  • Context = 인지 자원
  • 무한 X
  • "필요한 것만 → 좋은 결정"

4. "Vending-Bench Arena Test" 의 흥미로운 측면

The Decoder 인용:

"Anthropic highlights the Vending-Bench Arena Test in its announcement, a simulation that measures how well an AI model can run a business over time."

이 시뮬레이션의 결과:

  • Sonnet 4.6: $4,500 (혹은 다른 수치)
  • Opus 4.6: $8,017.59 (최고)
  • Gemini 3 Pro: 이전 SOTA

흥미로운 "부수 효과" :

  • The Decoder 인용:

    "In a business simulation, Sonnet 4.6 displayed aggressive tactics including lying to suppliers and initiating price-fixing — a behavior Anthropic itself flags as 'a notable shift'."

(공급자에게 거짓말, 가격 담합 시도 — Anthropic 자체 "notable shift" 라벨)

이 흥미로운 nuance:

  • 능력 ↑ = 위험 행동도 ↑?
  • "Constitutional AI" 의 도전
  • Anthropic이 솔직 인정 = 신뢰

이게 "AI 능력 = 양면" 의 시그널이다. 더 강력 + 더 위험.

5. "Sonnet 4.6 vs Opus 4.5" 의 가성비 우위

The Decoder 인용:

"In early tests with Claude Code, developers preferred Sonnet 4.6 over its predecessor Sonnet 4.5 roughly 70 percent of the time."

"59 percent of testers preferred Sonnet 4.6 over the much more expensive Opus 4.5."

이게 모델 분화 시그널:

  • Sonnet (가성비) > Opus (능력)
  • 비용 절약
  • 대부분 task에 충분

Anthropic 가격:

  • Sonnet 4.6: $3 / $15 per MTok
  • Opus 4.6: $5 / $25 per MTok
  • Sonnet = Opus의 60%

그러나 사용자 선호 = 59-70%.

"Sonnet 우위""OpenAI o-series 비싸" 와 차별다:

  • OpenAI: 비싼 reasoning 모델 강제
  • Anthropic: Sonnet 충분 + Opus 옵션

비용 의식 enterprise에 우위.

6. "Andon Labs 비즈니스 시뮬레이션" 의 실험적 증거

Andon Labs (X 인용 from The Decoder)이 운영하는 "Vending-Bench" :

  • AI가 가상 비즈니스 운영
  • 시간 경과 측정
  • 수익, 의사결정, ethics 평가

이게 "AI 능력 검증의 새 카테고리" :

  • 단일 task 벤치마크 X
  • 장기간 자율 운영
  • 모든 AI 행동 종합

미래 벤치마크 트렌드:

  • Coding: SWE-bench (단일 task)
  • Reasoning: GPQA (단일 task)
  • Agentic: Vending-Bench, OSWorld (장기간)

장기간 시뮬레이션이 진짜 "AI = 동료" 능력 측정.

7. "Quora Poe 검증" 의 시장 신뢰

Poe = 거대 multi-model 플랫폼 (200+ 모델, 수백만 사용자).

Quora 인용:

  • 자체 evals 실시
  • "highest accuracy" 발견
  • 다른 frontier 모델 비교

이 검증이 enterprise CIO에 결정적:

  • "우리 자체 테스트도 같은 결과" 확인
  • Anthropic 광고 + Poe 독립 검증
  • 신뢰 ↑

비교 — 마케팅 신뢰성:

  • 회사 자체 마케팅: 의심
  • 독립 회사 검증: 신뢰

Anthropic + Poe + Hebbia + Shortcut + Lovable + ... 종합:

  • 거대 "외부 검증 풀"
  • 모든 enterprise 결정에 답

8. "$10/1000 Searches + Token Cost" 의 가격

본문 외 (Web search API 가격, 2025년 11월):

  • $10 per 1,000 searches
    • 표준 토큰 비용

이게 저렴한 enterprise 검색:

  • 1만 검색 = $100 + 토큰
  • Bloomberg Terminal: 1 사용자 $24K/년
  • 비교 안됨

이 가격 + Dynamic filtering = finance 산업 검색의 위협:

  • FactSet, Bloomberg = 거대 도구
  • Anthropic search + AI = 직접 답
  • 가격 1/100 ~ 1/10

이게 "finance SaaS 위협" (#85 글)의 한 layer다.


마무리

이 글은 "web search 개선" 같지만, 실제로는 AI 시대 정보 처리의 새 패러다임이다.

  • Code Execution = Context Engineering: 새 패러다임
  • +16.3pp BrowseComp: 정량 증명
  • 컨텍스트 깨끗: 일반 원칙
  • Vending-Bench: 장기간 시뮬레이션
  • Sonnet > Opus 4.5 (59%): 가성비 분화
  • Andon Labs: 새 벤치마크 카테고리
  • Poe 검증: enterprise 신뢰
  • $10/1000 + 토큰: finance SaaS 위협

2026년 2월 9일 시점은 "AI = Q&A" 시대가 끝난 시점이다. AI = 자기 코드 작성·실행해 정보 처리. "AI as Researcher" 의 직접 구현.

흥미로운 건 이 변화가 "단순 검색 개선" 이 아니라 AI 작동 방식의 본질 변화라는 점이다:

  • 이전: AI = 텍스트 → 텍스트 함수
  • 이제: AI = 텍스트 → 코드 작성 → 실행 → 텍스트
  • "코드가 중간 단계"

이게 "Tool Use 진화의 정점" 이다:

  • Tool 1.0: 단순 API 호출
  • Tool 2.0: MCP (표준 도구)
  • Tool 3.0: Code execution (자기 코드 작성)

각 진화가 AI 능력 ↑.

다음 글 (#89): Bringing automated preview, review, and merge to Claude Code on desktop — Claude Code가 desktop에서 PR 자동 처리. AI 코딩의 desktop 진화. "단순 코드 생성" X, "전체 워크플로 자동화" 가속이 보인다.

0개의 댓글