Abstract
- LLM이 일부 financial tasks에서 잘하는 모습을 보이고 있지만, sequential financial decision making 에서는 volatile environment와 intelligent risk management의 필요성 때문에 한계가 있다.
- mulit-source information을 활용하는 것과 시기적절한 경험적 refinement를 통한 decision making은 underexplored 되어 있다.
- Conceptual verbal reinforcement for diverse Financial tasks를 제안한다.
- manager-analyst hierarchy
- dual-level risk-control component
- conceptualized beliefs는 필요한 agent에게만 future decision에 대한 verbal reinforcement를 제공한다.
Introduction
- 이 task의 제 1 목적은 open-ended environment에서 이익을 최대화하고 market risk를 최소화하는 것이다.
- 실제 trading firms에서 하는 것처럼 data analysts, risk analysts, portfolio managers간의 structured hierarchy synthesized teamwork가 필요하다.
- 이를 위해서 2가지 중요한 요소가 있다.
- agents들이 좋은 teamwork와 효율적인 communication을 하도록 하는 것
- agent 스스로 그들의 action을 refine하는 것
- human organizational structure를 mimic하는 것이 좋은 성능을 보이고 있는데, textual gradient based prompt optimization, verbal reinforcement들을 활용하여 decision making 성능을 향상시킬 수 있다.
- 기존의 work들은 long-term risk exposure에 대해서는 다루지 않았고, 또 portfolio management 같은 multi-asset을 다루진 않았다.
- FINCON, multi-agent framework for critical financial tasks.
- Synthesized Manager-Analyst hierarchical communication structure
- adaptable to portfolio management
- dual-level risk control component
- within episode : CVaR
- across episode : verbal reinforcement (investment beliefs are updated based on reasoning trajectories and PnL) distilled into conceptual perspectives
Architecture of FINCON

Manager-Analyst Agent Group
- analyst agents가 각각의 특화된 소스로부터 정보를 모아서 concise insight를 전달한다. 이는 human의 work 방식과 유사하다.
- daily news, financial reports 정보들을 받는 에이전트들이 존재한다.
- manager agent는 decision making을 한다.
- 각 analyst 들의 의견을 통합한다.
- timely risk alerts를 받는다.
- 그들의 투자 신념을 refine한다.
- 이전의 거래 액션과 추론을 바탕으로 자기반성을 한다.
Risk-Control Component
- within-episode risk control
- CVaR로 부터 alert을 받는다. 갑자기 CVaR가 많이 떨어지면 시장이 위험하다는 뜻
- over-episode risk control
- CVRF (conceptual verbal reinforcement)를 통해 투자 신념을 업데이트한다.
- 데이터 수집: k-1, k에서 수익을 낸 거래와 손실을 낸 거래를 식별하고 전체 성능 (CR 누적 수익률) 비교
- 개념화: risk-control component (Mr)에게 두 에피소드의 거래 데이터를 전달해서 LLM이 각 에피소드의 거래 패턴, 결정 시점, 시장 상황을 분석해서 분석결과를 투자 신념의 형태로 개념화
- 비교 및 추론 : 두 에피소드의 개념화된 투자신념 비교하고 인과관계 추론
- 신념 업데이트: 추론을 통해 신념 업데이트하고 매니저 에이전트 프롬프트에 통합, 관련된 analysts들에게 선택적으로 propagate
- abstraction을 통해 투자 신념과 전략을 개념화한다.
- 투자 신념을 메모리에 저장하여 이후 의사결정에 사용한다.
- 선택적으로 관련된 analyst에게만 정보를 전달한다.
Modular design of FINCON Agents
- agents들은 네가지 핵심 모듈로 구성되어있다. 이 역시 human의 방식을 답습한다.
- General Configuration and Profiling Module
- 일반적인 작업 유형에 대한 설명과 각 에이전트의 역할과 책임 개요
- Perception Module
- Memory Module
- working memory
- 관찰, 검색, 추출, 정제
- 데이터를 구조화된 인사이트로 변환
- procedural memory
- 에피소드 내 각 결정 단계 이후 생성
- 분석가 에이전트
- 추출된 투자 관련 인사이트
- 금융 시장 감성 평가
- 투자 보고서 권장 행동
- 매니저 에이전트
- 거래 행동 기록
- 의사결정 근거
- 반성 기록(자기 성찰)
- 중요 이벤트는 강화되고 사소한 이벤트는 점점 사라진다.
- episodic memory
- 장기 메모리이며 매니저만 보유한다.
- 이전 에피소드의 행동 기록
- PnL(수익 및 손실) 시리즈
- 위험 제어 컴포넌트에서 업데이트된 개념적 투자 신념
- example
- 분석가 에이전트가 뉴스 처리 시
- 작업 메모리: 오늘의 뉴스 기사 관찰, 내용 분석
- 절차적 메모리: 추출된, 구조화된 인사이트 저장
- 오래된 뉴스는 시간 경과에 따라 감소율(θ)에 의해 중요도 감소
- 매니저 에이전트의 의사결정 과정
- 작업 메모리: 분석가들의 인사이트 종합, 현재 시장 상황 평가
- 절차적 메모리: 결정 근거와 결과 저장
- 에피소드 메모리: 전체 거래 기간의 패턴 분석, 개념적 투자 원칙 적용
Experiments
연구 질문 (RQs)
- RQ1: FINCON이 single-asset trading과 portfolio management와 같은 다양한 금융 의사결정 작업에서 견고한 성능을 보이는가?
- RQ2: FINCON의 within-episode risk control mechanism이 우수한 의사결정 성능을 유지하는 데 효과적인가?
- RQ3: FINCON의 over-episode risk control mechanism이 manager agent의 신념을 시기적절하게 업데이트하여 거래 성능을 향상시키는가?
Setup
- Multi-Modal Datasets: 2022년 1월 3일부터 2023년 6월 10일까지의 stock prices, daily news, company filings (Form 10-Q, Form 10-K), ECC audio 데이터 사용
- Evaluation Metrics: Cumulative Return(CR%), Sharpe Ratio(SR), Max Drawdown(MDD%)
- Comparative Methods
- Single stock trading: DRL agents(A2C, PPO, DQN), LLM-based agents(GENERATIVE AGENT, FINGPT, FINMEM, FINAGENT), Buy-and-Hold(B&H) strategy
- Portfolio management: Markowitz MV, FinRL-A2C, Equal-Weighted ETF strategy
- Implementation Details
- 모든 LLM-based agent systems은 GPT-4-Turbo 사용, temperature parameter 0.3
- Training period: 2022년 1월 3일 ~ 2022년 10월 4일
- Testing period: 2022년 10월 5일 ~ 2023년 6월 10일
- DRL agents는 모델 convergence를 위해 더 많은 데이터(2018년 1월 1일 ~ 2022년 10월 4일) 사용
Results
Single Asset Trading Task
- FINCON이 8개 다른 주식에 대한 테스트에서 모든 LLM-based 및 DRL-based approaches보다 CRs과 SRs 측면에서 뛰어난 성능 달성
- 대부분의 trading assets에서 가장 낮은 MDD 값 중 하나를 기록하여 효과적인 risk management 입증
- 강세장(GOOG, MSFT), 약세장(NIO), 혼합장(TSLA) 등 다양한 market conditions에서 일관되게 우수한 성능 보임
- FINCON의 성능 우위는 synthesized multi-agent collaboration mechanism을 통한 고품질 정보 추출과 dual-level risk control design에 기인
Portfolio Management Task
- FINCON이 두 개의 소규모 포트폴리오 관리에서 Markowitz MV portfolio, FINRL, Equal-Weighted ETF보다 더 높은 CRs과 SRs 달성
- Portfolio 1(TSLA, MSFT, PFE): CR 113.836%, SR 3.269
- Portfolio 2(AMZN, GM, LLY): CR 32.922%, SR 1.371
- Multi-asset portfolios는 input length와 complexity 증가로 인해 hallucination 발생 가능성이 더 높지만, FINCON은 task distribution을 통해 이를 완화
Within-Episode Risk Control Mechanism의 효과 (RQ2에 대한 응답)
- CVaR(Conditional Value at Risk)를 사용한 within-episode risk control의 효과 검증을 위한 첫 번째 ablation study 수행
- CVaR 구현이 있는 FINCON vs 없는 FINCON 비교
- GOOG(강세장): CR 25.077% vs -1.461%
- NIO(약세장): CR 17.461% vs -52.887%
- Portfolio(혼합): CR 113.836% vs 14.699%
- CVaR는 bullish markets에서 immediate market shocks를 포착하고, bearish markets에서 significant price drops를 지속적으로 알리는 데 효과적
Over-Episode Risk Control Mechanism의 효과 (RQ3에 대한 응답)
- CVRF(Conceptual Verbal Reinforcement)를 사용한 over-episode investment belief updates의 효과 검증을 위한 두 번째 ablation study 수행
- Belief updates가 있는 FINCON vs 없는 FINCON 비교
- GOOG(강세장): CR 25.077% vs -11.944%
- NIO(약세장): CR 17.461% vs 8.197%
- Portfolio(혼합): CR 113.836% vs 28.432%
- FINCON은 4번의 training episodes 후 이러한 결과 달성(traditional RL algorithmic trading agents보다 훨씬 적은 에피소드 필요)
Analysis
- FINCON은 single-asset trading과 portfolio management 모두에서 견고한 성능 입증
- Within-episode risk control(CVaR)와 over-episode risk control(CVRF)가 모두 의사결정 성능 향상에 중요한 역할
- 특히 high volatility market environments에서도 우수한 성능을 보이며 FINCON의 robustness 확인
Conclusion
- LLM based multi-agent framework for financial desicion making
- Synthesized Manager-Analyst hierarchical structure
- specific한 analysts를 두고 manager가 통합하여 의사결정하는 방식
- 또한 episode 간 conceptual verbal reinforcement (텍스트로 투자 신념을 계속 업데이트 하는 방식) 과 CVaR를 이용한 within episode risk alert 방식 모두 도움이 되었다.
Takeaways
- multi-agent 방식이 financial tasks에서도 도움이 된다.
- agent간에 상호작용 방식이 배울만하다.
- verbal reinforcement를 적용한 점도 재미있다. 더군다나 concept로 한단계 추상화하여 적용시킨 점도 주목할만 하다.
- 실제로 evaluation한 과정이 배울만하다.