[논문 리뷰] FinCon: A Synthesized LLM Multi-Agent System with Conceptual Verbal Reinforcement for Enhanced Financial Decision Making

최동민·2025년 4월 5일

Paper review

목록 보기
9/15

Abstract

  • LLM이 일부 financial tasks에서 잘하는 모습을 보이고 있지만, sequential financial decision making 에서는 volatile environment와 intelligent risk management의 필요성 때문에 한계가 있다.
  • mulit-source information을 활용하는 것과 시기적절한 경험적 refinement를 통한 decision making은 underexplored 되어 있다.
  • Conceptual verbal reinforcement for diverse Financial tasks를 제안한다.
    • manager-analyst hierarchy
    • dual-level risk-control component
  • conceptualized beliefs는 필요한 agent에게만 future decision에 대한 verbal reinforcement를 제공한다.

Introduction

  • 이 task의 제 1 목적은 open-ended environment에서 이익을 최대화하고 market risk를 최소화하는 것이다.
  • 실제 trading firms에서 하는 것처럼 data analysts, risk analysts, portfolio managers간의 structured hierarchy synthesized teamwork가 필요하다.
  • 이를 위해서 2가지 중요한 요소가 있다.
    • agents들이 좋은 teamwork와 효율적인 communication을 하도록 하는 것
    • agent 스스로 그들의 action을 refine하는 것
  • human organizational structure를 mimic하는 것이 좋은 성능을 보이고 있는데, textual gradient based prompt optimization, verbal reinforcement들을 활용하여 decision making 성능을 향상시킬 수 있다.
  • 기존의 work들은 long-term risk exposure에 대해서는 다루지 않았고, 또 portfolio management 같은 multi-asset을 다루진 않았다.
  • FINCON, multi-agent framework for critical financial tasks.
    • Synthesized Manager-Analyst hierarchical communication structure
    • adaptable to portfolio management
    • dual-level risk control component
      • within episode : CVaR
      • across episode : verbal reinforcement (investment beliefs are updated based on reasoning trajectories and PnL) distilled into conceptual perspectives

Architecture of FINCON

Manager-Analyst Agent Group

  • analyst agents가 각각의 특화된 소스로부터 정보를 모아서 concise insight를 전달한다. 이는 human의 work 방식과 유사하다.
  • daily news, financial reports 정보들을 받는 에이전트들이 존재한다.
  • manager agent는 decision making을 한다.
    • 각 analyst 들의 의견을 통합한다.
    • timely risk alerts를 받는다.
    • 그들의 투자 신념을 refine한다.
    • 이전의 거래 액션과 추론을 바탕으로 자기반성을 한다.

Risk-Control Component

  • within-episode risk control
    • CVaR로 부터 alert을 받는다. 갑자기 CVaR가 많이 떨어지면 시장이 위험하다는 뜻
  • over-episode risk control
    • CVRF (conceptual verbal reinforcement)를 통해 투자 신념을 업데이트한다.
      • 데이터 수집: k-1, k에서 수익을 낸 거래와 손실을 낸 거래를 식별하고 전체 성능 (CR 누적 수익률) 비교
      • 개념화: risk-control component (Mr)에게 두 에피소드의 거래 데이터를 전달해서 LLM이 각 에피소드의 거래 패턴, 결정 시점, 시장 상황을 분석해서 분석결과를 투자 신념의 형태로 개념화
      • 비교 및 추론 : 두 에피소드의 개념화된 투자신념 비교하고 인과관계 추론
      • 신념 업데이트: 추론을 통해 신념 업데이트하고 매니저 에이전트 프롬프트에 통합, 관련된 analysts들에게 선택적으로 propagate
    • abstraction을 통해 투자 신념과 전략을 개념화한다.
    • 투자 신념을 메모리에 저장하여 이후 의사결정에 사용한다.
    • 선택적으로 관련된 analyst에게만 정보를 전달한다.

Modular design of FINCON Agents

  • agents들은 네가지 핵심 모듈로 구성되어있다. 이 역시 human의 방식을 답습한다.
    • General Configuration and Profiling Module
      • 일반적인 작업 유형에 대한 설명과 각 에이전트의 역할과 책임 개요
    • Perception Module
      • 각 에이전트가 상호작용하는 방식
    • Memory Module
      • working memory
        • 관찰, 검색, 추출, 정제
        • 데이터를 구조화된 인사이트로 변환
      • procedural memory
        • 에피소드 내 각 결정 단계 이후 생성
        • 분석가 에이전트
          • 추출된 투자 관련 인사이트
          • 금융 시장 감성 평가
          • 투자 보고서 권장 행동
        • 매니저 에이전트
          • 거래 행동 기록
          • 의사결정 근거
          • 반성 기록(자기 성찰)
        • 중요 이벤트는 강화되고 사소한 이벤트는 점점 사라진다.
      • episodic memory
        • 장기 메모리이며 매니저만 보유한다.
          • 이전 에피소드의 행동 기록
          • PnL(수익 및 손실) 시리즈
          • 위험 제어 컴포넌트에서 업데이트된 개념적 투자 신념
      • example
        1. 분석가 에이전트가 뉴스 처리 시
          • 작업 메모리: 오늘의 뉴스 기사 관찰, 내용 분석
          • 절차적 메모리: 추출된, 구조화된 인사이트 저장
          • 오래된 뉴스는 시간 경과에 따라 감소율(θ)에 의해 중요도 감소
        2. 매니저 에이전트의 의사결정 과정
          • 작업 메모리: 분석가들의 인사이트 종합, 현재 시장 상황 평가
          • 절차적 메모리: 결정 근거와 결과 저장
          • 에피소드 메모리: 전체 거래 기간의 패턴 분석, 개념적 투자 원칙 적용

Experiments

연구 질문 (RQs)

  • RQ1: FINCON이 single-asset trading과 portfolio management와 같은 다양한 금융 의사결정 작업에서 견고한 성능을 보이는가?
  • RQ2: FINCON의 within-episode risk control mechanism이 우수한 의사결정 성능을 유지하는 데 효과적인가?
  • RQ3: FINCON의 over-episode risk control mechanism이 manager agent의 신념을 시기적절하게 업데이트하여 거래 성능을 향상시키는가?

Setup

  • Multi-Modal Datasets: 2022년 1월 3일부터 2023년 6월 10일까지의 stock prices, daily news, company filings (Form 10-Q, Form 10-K), ECC audio 데이터 사용
  • Evaluation Metrics: Cumulative Return(CR%), Sharpe Ratio(SR), Max Drawdown(MDD%)
  • Comparative Methods
    • Single stock trading: DRL agents(A2C, PPO, DQN), LLM-based agents(GENERATIVE AGENT, FINGPT, FINMEM, FINAGENT), Buy-and-Hold(B&H) strategy
    • Portfolio management: Markowitz MV, FinRL-A2C, Equal-Weighted ETF strategy
  • Implementation Details
    • 모든 LLM-based agent systems은 GPT-4-Turbo 사용, temperature parameter 0.3
    • Training period: 2022년 1월 3일 ~ 2022년 10월 4일
    • Testing period: 2022년 10월 5일 ~ 2023년 6월 10일
    • DRL agents는 모델 convergence를 위해 더 많은 데이터(2018년 1월 1일 ~ 2022년 10월 4일) 사용

Results

Single Asset Trading Task

  • FINCON이 8개 다른 주식에 대한 테스트에서 모든 LLM-based 및 DRL-based approaches보다 CRs과 SRs 측면에서 뛰어난 성능 달성
  • 대부분의 trading assets에서 가장 낮은 MDD 값 중 하나를 기록하여 효과적인 risk management 입증
  • 강세장(GOOG, MSFT), 약세장(NIO), 혼합장(TSLA) 등 다양한 market conditions에서 일관되게 우수한 성능 보임
  • FINCON의 성능 우위는 synthesized multi-agent collaboration mechanism을 통한 고품질 정보 추출과 dual-level risk control design에 기인

Portfolio Management Task

  • FINCON이 두 개의 소규모 포트폴리오 관리에서 Markowitz MV portfolio, FINRL, Equal-Weighted ETF보다 더 높은 CRs과 SRs 달성
  • Portfolio 1(TSLA, MSFT, PFE): CR 113.836%, SR 3.269
  • Portfolio 2(AMZN, GM, LLY): CR 32.922%, SR 1.371
  • Multi-asset portfolios는 input length와 complexity 증가로 인해 hallucination 발생 가능성이 더 높지만, FINCON은 task distribution을 통해 이를 완화

Within-Episode Risk Control Mechanism의 효과 (RQ2에 대한 응답)

  • CVaR(Conditional Value at Risk)를 사용한 within-episode risk control의 효과 검증을 위한 첫 번째 ablation study 수행
  • CVaR 구현이 있는 FINCON vs 없는 FINCON 비교
    • GOOG(강세장): CR 25.077% vs -1.461%
    • NIO(약세장): CR 17.461% vs -52.887%
    • Portfolio(혼합): CR 113.836% vs 14.699%
  • CVaR는 bullish markets에서 immediate market shocks를 포착하고, bearish markets에서 significant price drops를 지속적으로 알리는 데 효과적

Over-Episode Risk Control Mechanism의 효과 (RQ3에 대한 응답)

  • CVRF(Conceptual Verbal Reinforcement)를 사용한 over-episode investment belief updates의 효과 검증을 위한 두 번째 ablation study 수행
  • Belief updates가 있는 FINCON vs 없는 FINCON 비교
    • GOOG(강세장): CR 25.077% vs -11.944%
    • NIO(약세장): CR 17.461% vs 8.197%
    • Portfolio(혼합): CR 113.836% vs 28.432%
  • FINCON은 4번의 training episodes 후 이러한 결과 달성(traditional RL algorithmic trading agents보다 훨씬 적은 에피소드 필요)

Analysis

  • FINCON은 single-asset trading과 portfolio management 모두에서 견고한 성능 입증
  • Within-episode risk control(CVaR)와 over-episode risk control(CVRF)가 모두 의사결정 성능 향상에 중요한 역할
  • 특히 high volatility market environments에서도 우수한 성능을 보이며 FINCON의 robustness 확인

Conclusion

  • LLM based multi-agent framework for financial desicion making
  • Synthesized Manager-Analyst hierarchical structure
  • specific한 analysts를 두고 manager가 통합하여 의사결정하는 방식
  • 또한 episode 간 conceptual verbal reinforcement (텍스트로 투자 신념을 계속 업데이트 하는 방식) 과 CVaR를 이용한 within episode risk alert 방식 모두 도움이 되었다.

Takeaways

  • multi-agent 방식이 financial tasks에서도 도움이 된다.
  • agent간에 상호작용 방식이 배울만하다.
  • verbal reinforcement를 적용한 점도 재미있다. 더군다나 concept로 한단계 추상화하여 적용시킨 점도 주목할만 하다.
  • 실제로 evaluation한 과정이 배울만하다.
profile
코리안코린이

0개의 댓글