멀티암드 밴딧(Multi-Armed Bandit, MAB)은 확률론과 기계 학습(강화 학습)에서 제한된 리소스를 여러 대안(선택지)에 어떻게 최적으로 배분할 것인가를 다루는 고전적인 문제 프레임워크입니다. [1]
MAB의 핵심은 탐색과 활용의 균형(Trade-off)을 잡는 것입니다. [1, 4]
탐색과 활용의 딜레마를 해결하기 위해 여러 수학적 알고리즘이 사용됩니다. [5, 7]
현업(마케팅, 서비스 기획)에서 MAB는 전통적인 A/B 테스트의 대안이자 확장판으로 자주 쓰입니다. [3, 6]
| 비교 항목 | A/B 테스트 | 멀티암드 밴딧 (MAB) |
|---|---|---|
| 운영 방식 | 실험 기간 동안 트래픽을 50:50으로 고정하여 순수 탐색 | 성과 데이터에 따라 트래픽 배분율을 실시간으로 자동 조정 |
| 목적 | 어떤 안이 더 우수한지 통계적 유의성 검증 | 실험 진행과 동시에 기대 수익(클릭률, 매출 등)을 극대화 |
| 기회비용 (Regret) | 성과가 나쁜 안에도 끝까지 50%의 트래픽이 가므로 손실이 큼 | 나쁜 안의 비중을 빠르게 줄이므로 손실(Regret)을 최소화 |
멀티암드 밴딧과 관련하여 더 구체적인 알고리즘 수식이나 파이썬 구현 코드, 또는 A/B 테스트와의 실무적 차이점 중 어떤 부분을 더 자세히 알아보고 싶으신가요?
[1][https://ko.wikipedia.org](https://ko.wikipedia.org/wiki/%EB%A9%80%ED%8B%B0_%EC%95%94%EB%93%9C_%EB%B0%B4%EB%94%A7)
[2][https://glanceyes.com](https://glanceyes.com/entry/%EC%B6%94%EC%B2%9C-%EC%8B%9C%EC%8A%A4%ED%85%9C-Multi-Armed-BanditMAB-%EC%95%8C%EA%B3%A0%EB%A6%AC%EC%A6%98)
[3][https://playinpap.github.io](https://playinpap.github.io/mab/)
[4][https://www.alphaxiv.org](https://www.alphaxiv.org/ko/abs/1904.10040)
[5][https://m.blog.naver.com](https://m.blog.naver.com/nilsine11202/221912267111)
[6][https://brunch.co.kr](https://brunch.co.kr/@chris-song/62)
[7][https://velog.io](https://velog.io/@so_yeong/%EB%A9%80%ED%8B%B0%EC%95%94%EB%93%9C-%EB%B0%B4%EB%94%A7-%EC%95%8C%EA%B3%A0%EB%A6%AC%EC%A6%98)
[8][https://sungkee-book.tistory.com](https://sungkee-book.tistory.com/14)
[9][https://koosco.tistory.com](https://koosco.tistory.com/entry/ML-MABMulti-Armed-Bandit-Algorithm-%EB%A9%80%ED%8B%B0-%EC%95%94%EB%93%9C-%EB%B0%B4%EB%94%A7)
[10][https://wikidocs.net](https://wikidocs.net/blog/@datalearners/30243/)
[11][https://www.youtube.com](https://www.youtube.com/watch?v=9pZv3-6EUq8&t=7)