HDC LABS NOVA 1기 - week1 후기

yoon·2025년 9월 7일

HDC LABS NOVA 1기

목록 보기
1/7
post-thumbnail

☺︎ Why?

처음에는 학부 연구생을 하면서 2025 하반기를 보낼 생각이었다.
7월은 체코에서 돌아와 일상에 적응하면서 가고 싶은 연구실을 찾고 하고 싶은 것들 다 하면서 방학을 보내던 중 우연히 HDC LABS NOVA 지원링크를 전달받게 되었다.

2차 모집 마감 d-2,
HDC LABS가 무슨 회사인지도 몰랐던 내가 끌렸던 이유는 딱 두 가지였다.

HDC랩스 데이터(IoT, 영상, 음성 등)를 이용한 프로젝트 가능
학교 다닐 때 했던 프로젝트들에서는 이 데이터를 찾는 게 정말 고역이었다. 손수 크롤링을 하거나 공공 데이터, AI hub 데이터를 이용할 수 밖에 없어, 데이터를 못 구해 프로젝트 방향을 아예 바꾼 적도 있었다.
이 부트캠프를는 실무 데이터를 활용하여 프로젝트를 진행할 수 있다는 점이 정말 큰 메리트라고 생각했다. 그 중에서도 부동산 데이터 기반 AIoT 통합 서비스 개발 주제로 프로젝트를 진행한다면 재밌을 것 같다고 생각했다.

현직자 강의 & 멘토링
실제 현업에서는 어떤 식으로 프로젝트를 진행하고 관리하는 지가 항상 궁금했다.
우리끼리 매일 학교에서 "진짜 회사에서도 이런식으로 데이터를 처리한다고??"하면서 의문을 가졌다. 현직자가 직접 강의 및 멘토링을 해주시면서 이런 궁금증이 좀 더 해소되고 실제 취업에 조금 더 가깝게 도움을 받을 수 있지 않을까하는 생각이었다.

  • 그 외에도 우리 학교에서는 인도네시아 교수님이 데이터 수업을 전적으로 맡아 강의하시다보니.. 수업 때 100% 이해한 적이 많지 않고, 제대로 배워보고 싶다는 생각을 많이 하긴했다.
    파이썬부터 SQL, 머신 러닝~딥러닝까지 체계적으로 전문 강사님께 배워보고, 컴공에서 다루지만 항상 배워보고 싶었던 CV, LLM까지 배우는 커리큘럼이다보니 나에게 굉장히 fit해보였다.
  • 한학기동안 제대로된 프로젝트로 포폴 쌓기
  • 우수 수료생은 HDC LABS 서류 면제

그렇지만 주변에서 들어본 SAFFY, Naver 등 유명한 부트캠프도 아니었고 뭐가 뭔지 하나도 몰라 고민을 했지만..
일단 시간과 기회가 있으니 일단 GO . 유명한 부트캠프들은 코딩테스트 준비한다고 고민만 하다가 지원도 못했을 것 같다. 어차피 해야하는 휴학. 시간을 그냥 흘려보내기보단 하길 잘 한 것 같다.


power 개발자를 꿈꾸며 ..


☺︎ week1 : 현직자 특강

25.08.26 Tue - 부트캠프 시작
week1은 무려 5일동안 현직자 특강으로 진행되었다.
HDC LABS AI LAB의 NLP, CV, DS 파트의 현직자 분들이 오셔서 각 분야에 대해 강의를 해주셨다.

✔︎ NLP [AIoT 음성 챗봇 만들기]

🌐 실습도구

  • STT : Whisper model 다운받아 실행 [edge Layer]
  • LLM: Groq 클라우드 서비스 (API 사용) [Cloud Layer]
  • TTS: Edge-TTS [Cloud Layer]

🌐 Edge-Cloud 분산 아키텍처

- Edge Layer: 데이터 발생지점에서 처리
	→ 빅스비/시리 같은 Wake Word감지 (항상 대기: 전력 소모가 심함.. )
    → 장점: 빠른 응답, 네트워크 독립
- Cloud Layer:  중앙서버/데이터 센터를 이용
	→ 클라우드에서 처리된 결과를 다시 edge로 전달
    → 장점: 강력한 AI, 최신 정보, 복잡한 추론  

🔄 음성챗봇 처리 파이프라인

👤 사용자 음성 → 🎤 STT → 🧠 LLM → 🔊 TTS → 🔈 AI 음성


1. SST 기술 심화 [Whisper 중심]

STT

  • 기술: Transformer
  • 특징: 다국어 지원
  • 대표 사례: Whisper, Wav2Vec

🏗️ 모델 구조

📊 Audio Input (16kHz)
    ⬇️
🔄 Mel-Spectrogram 변환
    ⬇️  
🧠 Encoder (음성 특징 추출)
    ⬇️
🧠 Decoder (텍스트 생성)
    ⬇️
📝 Text Output (UTF-8)

📊 모델 크기별 특성

모델크기처리속도정확도💡 용도
tiny39MB⚡⚡⚡80%실시간 서비스
base74MB⚡⚡85%🎓 교육용 적합
small244MB90%일반 앱
large1.55GB🐌95%고정밀 서비스

🆚 주요 STT 기술 비교

기술장점단점비용
🚀 Whisper✅ 99개 언어
✅ 오픈소스
✅ 노이즈 강건성
❌ 실시간 제한
❌ GPU 필요
🆓 무료
🌐 Google Cloud STT✅ 실시간 스트리밍
✅ 높은 정확도
✅ 한국어 우수
❌ 인터넷 필수
❌ 벤더 종속
💰 $0.006/분
🇰🇷 네이버 클로바✅ 한국어 특화
✅ 방언 지원
✅ 데이터 주권
❌ 다국어 제한
❌ 글로벌 확장성
💰 유료
🔒 Mozilla DeepSpeech✅ 완전 오픈소스
✅ 프라이버시
✅ 로컬 처리
❌ 낮은 정확도
❌ 한국어 제한
🆓 무료

→ 무료로 사용: Whisper
→ 한국어로 높은 정확도: 네이버 클로바
사용하는 게 좋을 듯하죠?

2. LLM 기술 심화 - Groq 중심

플랫폼처리속도토큰/초지연시간🎯 특징
⚡ Groq최고속500-10000.1초실시간 대화 최적
🤖 OpenAI보통50-1001-2초높은 성능
🎭 Anthropic느림30-802-3초안전성 우수
🌐 Google Gemini보통100-2001초멀티모달

Groq = 클라우드 서비스, AI 모델 추론에서 초고속 연산을 지원하는 하드웨어 및 소프트웨어 솔루션을 제공하는 기업과 그 기술을 가르킴. GPU 대안으로 주목받고 있음. (LPU라는 자체 아키텍처를 사용, GPU 대신 낮은 전력 소모로 에너지 효율이 높음)

→ GPU 없이 사용 가능, 로컬 환경(또는 Colab CPU 런타임)에서 API 호출만 하면 됨. 
모델 연산은 Groq 서버에서 수행하므로 컴퓨터 성능과는 무관

🏗️ LPU 기술

LPU (Language Processing Unit)

GPU 대비 10배 빠른 토큰 생성 속도

초당 500-1000 토큰 생성 가능

3. TTS 기술 심화 - Edge TTS 중심

TTS

  • 기술: Neural TTS
  • 특징: 기존 통계 기반에 비해 사람과 구별이 어려운 목소리
  • 대표 사례: Edge-TTS, ElevenLabs

🆚 주요 TTS 기술 비교

TTS 서비스🎵 자연도🇰🇷 한국어💰 비용⚡ 속도🎯 특화 분야
🔥 Edge-TTS⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐교육/프로토타입
🎭 ElevenLabs⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐음성 복제, 콘텐츠
🌐 Google Cloud TTS⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐기업 서비스
📦 AWS Polly⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐뉴스, 비즈니스
🇰🇷 클로바 Voice⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐한국어 전용
🎬 TYPECAST⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐⭐더빙, 콘텐츠 제작

→ ElevenLabs가 가장 자연스럽지만 비용문제로, 상업적 품질을 무료로 제공하는 Edge-TTS를 많이 사용


🚀 지연시간 최소화

방식순차 처리 (기본)병렬 처리 (최적화)
처리 방식STT → LLM → TTSSTT + LLM 동시 시작
총 시간6초 (3+2+1)3-4초
개선율기준40% 단축

🎯 (실제 구현시) 비용 절감 전략

📦 캐싱 활용

자주 묻는 질문 → 미리 생성된 응답 사용

🎚️ 모델 선택

간단한 질문 → 작은 모델

복잡한 질문 → 큰 모델


✔︎ AI/ML 기본 지식

📌 AI > 머신러닝 > 딥러닝

  • 머신러닝 (ML)
    • 정형 데이터 기반, 패턴 탐색 (예: 온습도 센서, 서버 로그 등)
  • 딥러닝 (DL)
    • 비정형 데이터(이미지, 텍스트) 처리
    • GPU 필요, 학습 시간 길다
  • 머신러닝은 블랙박스 성격 → 전적으로 맡기기엔 위험

⚙️ 모델링 프로세스

  1. 문제 정의
  2. 데이터 수집
  3. 데이터 탐색
    • 분포 확인
    • 이상치/결측치 처리
    • 변수 간 상관성 확인
  4. 데이터 전처리
    • 결측값 처리, 데이터 통합
    • 원핫인코딩
    • 비정형 데이터 행렬 변환 등
  5. 모델링
    • 모델 선택, 하이퍼파라미터 설정, 학습
  6. 모델 평가
    • Precision, Recall, Accuracy, F1 Score 등

🔄 피드백 루프: 평가 → 전처리 → 모델링 반복

💡 주요 개념

  • Chain of Thought: 모델이 추론 과정을 단계적으로 설명하도록 유도
  • Few-shot Learning: 예시 기반 학습
  • Prompt Engineering: 프롬프트 설계 중요
  • Fine-tuning: LORA 등 경량화 방식 활용
  • RAG (Retrieval-Augmented Generation): 벡터 검색 기반 지식 활용

☁️ 느낀점

NLP, CV, LLM, DS .. 그냥 뭉뚱그려 데이터 라고만 알고 있던 내게 세분화하여 정리될 수 있는 아주 유익한 시간이었다.

학부 때 주변에서 사용하라고 권해서 뭔지도 제대로 모르고 써봤던 Hugging Face, Kaggle, Dacon 등 데이터 공유 플랫폼이나 RAG, LoRA 등의 기법들에 대해 거시적인 개념들을 잡을 수 있어서 좋았다.
그리고 바이브 코딩의 도구들 Cursor, claude code. 처음들어보는데 점점 IT 지식이 늘어가는 것 같아 즐거웠음~..
특히, DAY3에 NLP 파트에서 오신 현직자 분의 특강이 가장 유익했다. 작년에 데이콘 AI 경진대회에서 뭔지도 모르고 사용했던 STT, TTS 모델들의 종류들도 명확히 알게 되었고, 프로젝트 진행 시 주요 모델들의 선택 기준(?)을 정리해서 알려주셔서 재밌었다.
(뭐가 뭔지도 모르고 일단 GPT가 쓰라는 대로 사용하다가, 모델들의 개념, 장단점 및 활용 방안을 알게 되어서 좋았달까..)

0개의 댓글