
처음에는 학부 연구생을 하면서 2025 하반기를 보낼 생각이었다.
7월은 체코에서 돌아와 일상에 적응하면서 가고 싶은 연구실을 찾고 하고 싶은 것들 다 하면서 방학을 보내던 중 우연히 HDC LABS NOVA 지원링크를 전달받게 되었다.
2차 모집 마감 d-2,
HDC LABS가 무슨 회사인지도 몰랐던 내가 끌렸던 이유는 딱 두 가지였다.
❶ HDC랩스 데이터(IoT, 영상, 음성 등)를 이용한 프로젝트 가능
학교 다닐 때 했던 프로젝트들에서는 이 데이터를 찾는 게 정말 고역이었다. 손수 크롤링을 하거나 공공 데이터, AI hub 데이터를 이용할 수 밖에 없어, 데이터를 못 구해 프로젝트 방향을 아예 바꾼 적도 있었다.
이 부트캠프를는 실무 데이터를 활용하여 프로젝트를 진행할 수 있다는 점이 정말 큰 메리트라고 생각했다. 그 중에서도 부동산 데이터 기반 AIoT 통합 서비스 개발 주제로 프로젝트를 진행한다면 재밌을 것 같다고 생각했다.
❷ 현직자 강의 & 멘토링
실제 현업에서는 어떤 식으로 프로젝트를 진행하고 관리하는 지가 항상 궁금했다.
우리끼리 매일 학교에서 "진짜 회사에서도 이런식으로 데이터를 처리한다고??"하면서 의문을 가졌다. 현직자가 직접 강의 및 멘토링을 해주시면서 이런 궁금증이 좀 더 해소되고 실제 취업에 조금 더 가깝게 도움을 받을 수 있지 않을까하는 생각이었다.
그렇지만 주변에서 들어본 SAFFY, Naver 등 유명한 부트캠프도 아니었고 뭐가 뭔지 하나도 몰라 고민을 했지만..
일단 시간과 기회가 있으니 일단 GO . 유명한 부트캠프들은 코딩테스트 준비한다고 고민만 하다가 지원도 못했을 것 같다. 어차피 해야하는 휴학. 시간을 그냥 흘려보내기보단 하길 잘 한 것 같다.

power 개발자를 꿈꾸며 ..
25.08.26 Tue - 부트캠프 시작
week1은 무려 5일동안 현직자 특강으로 진행되었다.
HDC LABS AI LAB의 NLP, CV, DS 파트의 현직자 분들이 오셔서 각 분야에 대해 강의를 해주셨다.
🌐 실습도구
Whisper model 다운받아 실행 [edge Layer]Groq 클라우드 서비스 (API 사용) [Cloud Layer]Edge-TTS [Cloud Layer]🌐 Edge-Cloud 분산 아키텍처
- Edge Layer: 데이터 발생지점에서 처리
→ 빅스비/시리 같은 Wake Word감지 (항상 대기: 전력 소모가 심함.. )
→ 장점: 빠른 응답, 네트워크 독립
- Cloud Layer: 중앙서버/데이터 센터를 이용
→ 클라우드에서 처리된 결과를 다시 edge로 전달
→ 장점: 강력한 AI, 최신 정보, 복잡한 추론
🔄 음성챗봇 처리 파이프라인
👤 사용자 음성 → 🎤 STT → 🧠 LLM → 🔊 TTS → 🔈 AI 음성
STT
🏗️ 모델 구조
📊 Audio Input (16kHz)
⬇️
🔄 Mel-Spectrogram 변환
⬇️
🧠 Encoder (음성 특징 추출)
⬇️
🧠 Decoder (텍스트 생성)
⬇️
📝 Text Output (UTF-8)
📊 모델 크기별 특성
| 모델 | 크기 | 처리속도 | 정확도 | 💡 용도 |
|---|---|---|---|---|
| tiny | 39MB | ⚡⚡⚡ | 80% | 실시간 서비스 |
| base | 74MB | ⚡⚡ | 85% | 🎓 교육용 적합 |
| small | 244MB | ⚡ | 90% | 일반 앱 |
| large | 1.55GB | 🐌 | 95% | 고정밀 서비스 |
🆚 주요 STT 기술 비교
| 기술 | 장점 | 단점 | 비용 |
|---|---|---|---|
| 🚀 Whisper | ✅ 99개 언어 ✅ 오픈소스 ✅ 노이즈 강건성 | ❌ 실시간 제한 ❌ GPU 필요 | 🆓 무료 |
| 🌐 Google Cloud STT | ✅ 실시간 스트리밍 ✅ 높은 정확도 ✅ 한국어 우수 | ❌ 인터넷 필수 ❌ 벤더 종속 | 💰 $0.006/분 |
| 🇰🇷 네이버 클로바 | ✅ 한국어 특화 ✅ 방언 지원 ✅ 데이터 주권 | ❌ 다국어 제한 ❌ 글로벌 확장성 | 💰 유료 |
| 🔒 Mozilla DeepSpeech | ✅ 완전 오픈소스 ✅ 프라이버시 ✅ 로컬 처리 | ❌ 낮은 정확도 ❌ 한국어 제한 | 🆓 무료 |
→ 무료로 사용: Whisper
→ 한국어로 높은 정확도: 네이버 클로바
사용하는 게 좋을 듯하죠?
| 플랫폼 | 처리속도 | 토큰/초 | 지연시간 | 🎯 특징 |
|---|---|---|---|---|
| ⚡ Groq | 최고속 | 500-1000 | 0.1초 | 실시간 대화 최적 |
| 🤖 OpenAI | 보통 | 50-100 | 1-2초 | 높은 성능 |
| 🎭 Anthropic | 느림 | 30-80 | 2-3초 | 안전성 우수 |
| 🌐 Google Gemini | 보통 | 100-200 | 1초 | 멀티모달 |
Groq = 클라우드 서비스, AI 모델 추론에서 초고속 연산을 지원하는 하드웨어 및 소프트웨어 솔루션을 제공하는 기업과 그 기술을 가르킴. GPU 대안으로 주목받고 있음. (LPU라는 자체 아키텍처를 사용, GPU 대신 낮은 전력 소모로 에너지 효율이 높음)
→ GPU 없이 사용 가능, 로컬 환경(또는 Colab CPU 런타임)에서 API 호출만 하면 됨.
모델 연산은 Groq 서버에서 수행하므로 컴퓨터 성능과는 무관
🏗️ LPU 기술
LPU (Language Processing Unit)
GPU 대비 10배 빠른 토큰 생성 속도
초당 500-1000 토큰 생성 가능
TTS
🆚 주요 TTS 기술 비교
| TTS 서비스 | 🎵 자연도 | 🇰🇷 한국어 | 💰 비용 | ⚡ 속도 | 🎯 특화 분야 |
|---|---|---|---|---|---|
| 🔥 Edge-TTS | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | 교육/프로토타입 |
| 🎭 ElevenLabs | ⭐⭐⭐⭐⭐ | ⭐⭐ | ⭐⭐ | ⭐⭐⭐ | 음성 복제, 콘텐츠 |
| 🌐 Google Cloud TTS | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | 기업 서비스 |
| 📦 AWS Polly | ⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ | 뉴스, 비즈니스 |
| 🇰🇷 클로바 Voice | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐ | 한국어 전용 |
| 🎬 TYPECAST | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐ | ⭐⭐⭐ | 더빙, 콘텐츠 제작 |
→ ElevenLabs가 가장 자연스럽지만 비용문제로, 상업적 품질을 무료로 제공하는 Edge-TTS를 많이 사용
🚀 지연시간 최소화
| 방식 | 순차 처리 (기본) | 병렬 처리 (최적화) |
|---|---|---|
| 처리 방식 | STT → LLM → TTS | STT + LLM 동시 시작 |
| 총 시간 | 6초 (3+2+1) | 3-4초 |
| 개선율 | 기준 | 40% 단축 |
🎯 (실제 구현시) 비용 절감 전략
📦 캐싱 활용
자주 묻는 질문 → 미리 생성된 응답 사용
🎚️ 모델 선택
간단한 질문 → 작은 모델
복잡한 질문 → 큰 모델
🔄 피드백 루프: 평가 → 전처리 → 모델링 반복
NLP, CV, LLM, DS .. 그냥 뭉뚱그려 데이터 라고만 알고 있던 내게 세분화하여 정리될 수 있는 아주 유익한 시간이었다.
학부 때 주변에서 사용하라고 권해서 뭔지도 제대로 모르고 써봤던 Hugging Face, Kaggle, Dacon 등 데이터 공유 플랫폼이나 RAG, LoRA 등의 기법들에 대해 거시적인 개념들을 잡을 수 있어서 좋았다.
그리고 바이브 코딩의 도구들 Cursor, claude code. 처음들어보는데 점점 IT 지식이 늘어가는 것 같아 즐거웠음~..
특히, DAY3에 NLP 파트에서 오신 현직자 분의 특강이 가장 유익했다. 작년에 데이콘 AI 경진대회에서 뭔지도 모르고 사용했던 STT, TTS 모델들의 종류들도 명확히 알게 되었고, 프로젝트 진행 시 주요 모델들의 선택 기준(?)을 정리해서 알려주셔서 재밌었다.
(뭐가 뭔지도 모르고 일단 GPT가 쓰라는 대로 사용하다가, 모델들의 개념, 장단점 및 활용 방안을 알게 되어서 좋았달까..)