
MLOps 플랫폼으로 MLflow를 선정하였다. 이유는 여러가지가 있는데 가장 큰 이유는 무료이면서 강력한 툴을 제공해주기 때문이다. 1. 개방성 및 유연성 (Framework Agnostic) MLflow는 특정 기술 스택에 얽매이지 않는 개방형(Open Sour

AWS Lightsail 로 MLflow 와 MySQL 서버를 띄울 것이다. 기본적인 것은 첫번째로 .pem 파일을 chmod 400 _ 윈도우는 chmod가 안되서 ubuntu를 깔고 홈으로 파일을 옮겨서 꾸역꾸역해야 될까말까_ 사용한 setup.sh 코드

MLflow UI는 확인했고 그다음은 MySQL. MySQL은 웹보다 까다롭다 데이터베이스의 보안 모델이 애플리케이션 포트보다 훨씬 엄격하기 때문 어떻게 알았냐고? 저도 알고싶지 않았습니다,, 🔑 MySQL 원격 접속의 3단계 보안 레이어 MLflow 과정은 이

MySQL 까지 연결됨을 확인했음 그러나 MySQL로 Artifact Store를 대체할 수 없따,, 그 이유는 왜냐면 Artifact Store 저장소의 성격 1. 데이터의 성격 차이 | 구분 | 파일(Artifacts)

저번 내용까지 해서 MLflow , MySQL, MinIO 까지 연결하여 저장소를 확보하였다. 이제 확보된 저장소를 통해서 서버로 서빙하는 것까지 알아보도록 하겠다. pip list 확인 Predict 함수의 역할 모델 예측 수행 predict() 함수는 사용자로

저번 시간 BentoML 을 통해 Input Feature를 통한 Output 이 나오는 하나의 모델 서빙 과정을 확인 하였다. 이번 시간엔 그 Input Feature 와 Model Training Data를 같이 관리할 수 있는 Feature Store에 대해 알
→ 발전을 위해 왔던 길을 Review하고 Improve 해나가는 과정메트릭은 시간별로 데이터가 수집되기에 그 양이 많다. 그래서 외부에 메트릭을 저장하는 DB를 두는데, 대표적으로 프로메테우스(Prometheus)가 있다.시간이 지남에 따라 추이가 변하는 데이터를 메

LLM 서버 성능 지표 완전 정리 LLM 서비스를 운영한다는 것은 단순히 모델을 띄워두는 것이 아니다. 사용자가 체감하는 속도, 서버가 감당할 수 있는 트래픽, GPU 비용까지 모두 수치로 측정하고 균형을 맞춰야 한다. 이 지표들은 각각 독립적으로 존재하는 것이 아니

LLM 서빙 트레이드오프 고찰 들어가며 LLM 서비스를 운영한다는 것은 끊임없는 선택의 연속이다. 빠르게 할 것인가 VS 많이 처리할 것인가. 품질을 지킬 것인가 VS 비용을 낮출 것인가. 쉽게 구축할 것인가 VS 성능을 극한까지 뽑을 것인가. 이 세 가지 트레

GPU에서의 딥러닝 , 메모리 구조 딥러닝 모델을 GPU에서 훈련시킨다는 것은 단순히 코드를 실행하는 것이 아니다. GPU의 제한된 VRAM 안에서 모델 파라미터, 그래디언트, 활성화 값, 옵티마이저 상태를 모두 올려두고 연산해야 한다. 메모리가 부족하면 OOM(O
모델 메타데이터 > AI 모델 자체(가중치)가 아니라, 모델에 대한 정보를 담고 있는 데이터. "모델의 신분증 + 사용 설명서" 같은 것. 데이터 종류 모델 기본 정보 모델 이름, 버전, 아키텍처 종류 (예: transformer, decoder-only) 파라미