DeepAR를 제안한 연구로, RNN(LSTM) 기반 자기회귀 모델을 이용해 여러 관련 시계열을 동시에 학습하고 미래 값을 확률분포 형태로 예측하는 방법을 제시
LLaVA(Large Language and Vision Assistant)를 제안한 연구로, Visual Instruction Tuning 기법을 통해 이미지와 텍스트를 함께 이해하고 사용자의 지시를 수행할 수 있는 멀티모달 대규모 언어모델을 학습하는 방법을 제시
BERT를 금융 도메인에 맞게 사전학습한 FinBERT를 제안한 연구
N-BEATS를 제안한 연구로, RNN이나 Transformer 없이 완전연결신경망(MLP)만을 사용하여 시계열 예측을 수행하면서도 높은 성능을 달성
Transformer를 최초로 제안한 연구로, 기존 RNN/LSTM 기반 Seq2Seq 모델을 대체하여 Self-Attention만으로 시퀀스를 처리하는 새로운 아키텍처를 제시
Seq2Seq(Sequence-to-Sequence) 모델을 처음 제안한 논문으로, LSTM 기반 Encoder-Decoder 구조를 사용하여 입력 시퀀스를 출력 시퀀스로 변환하는 방법을 제시
ResNet을 제안한 논문으로, Residual Block을 도입하여 매우 깊은 신경망에서도 기울기 소실 문제를 완화하고 성능을 크게 향상시킨 연구
Ultralytics의 YOLO11 아키텍처를 분석 및 정리한 리뷰 논문
YOLO는 객체 탐지를 하나의 단일 신경망으로 수행하는 최초의 대표적인 모델로, 기존의 R-CNN계열처럼 후보 영역을 생성하지 않고 이미지를 한 번만 처리하여 객체의 위치와 클래스를 동시에 예측함으로써 실시간 객체 탐지의 기반을 마련
ShuffleNet은 모바일 및 임베디드 환경을 위한 초경량 CNN으로, Pointwise Group Convolution과 Channel Shuffle을 도입하여 연산량(FLOPs)을 크게 줄이면서도 높은 정확도를 유지하는 것이 핵심
ConvNeXt를 제안한 논문으로, ResNet을 현대적으로 개선하여 Vision Transformer(ViT)에 필적하는 CNN 백본을 설계한 연구
시계열 데이터를 텍스트처럼 임베딩해서 LLM없이도 가볍고 강력한 분류 성능을 달성한 모델
Modern TCN은 대형 커널과 현대적 설계를 통해 attention없이도 Transformer을 능가하는 시계열 예측 모델