profile
AI ๐Ÿ˜Ž
post-thumbnail

Reinforcement Learning Conference (RLC) 2026: pre-RLC ์ฐธ์—ฌ ํ›„๊ธฐ

Reinforcement Learning Conference(RLC)๊ฐ€ ์–ด์ œ๋ถ€ํ„ฐ ์‹œ์ž‘๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ์˜ฌํ•ด RLC 2026์€ ์บ๋‚˜๋‹ค ๋ชฌํŠธ๋ฆฌ์˜ฌ์˜ Universitรฉ de Montrรฉal์—์„œ ์—ด๋ฆฌ๋Š”๋ฐ์š”. ์˜ค๋Š˜์€ ์–ด์ œ ์ง„ํ–‰๋œ pre-RLC workshop์— ์ฐธ์—ฌํ•œ ํ›„๊ธฐ๋ฅผ ๊ฐ„๋‹จํ•˜๊ฒŒ ๊ณต์œ ๋“œ๋ฆฌ๊ณ ์ž ํ•ฉ๋‹ˆ๋‹ค. Reinforcement Learning Conference...

4์ผ ์ „
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

Higgs TTS

Higgs TTS 3 ์‚ฌ์šฉ ํ›„๊ธฐ: Expressive TTS๋Š” ์ •๋ง ์›ํ•˜๋Š” ๊ฐ์ •์„ ๊ทธ๋Œ€๋กœ ๋งŒ๋“ค์–ด์ค„๊นŒ? ์˜ค๋Š˜์€ ์ตœ๊ทผ ๊ณต๊ฐœ๋œ TTS ๋ชจ๋ธ ์ค‘ ๊ฝค ์ธ์ƒ์ ์œผ๋กœ ์‚ฌ์šฉํ–ˆ๋˜ Higgs TTS 3์— ๋Œ€ํ•ด ๊ฐ„๋‹จํžˆ ์†Œ๊ฐœํ•˜๊ณ , ์‹ค์ œ๋กœ ์‚ฌ์šฉํ•˜๋ฉด์„œ ๋А๊ผˆ๋˜ ์žฅ์ ๊ณผ ์•„์‰ฌ์šด ์ ๋“ค์„ ๊ณต์œ ํ•ด๋ณด๋ ค๊ณ  ํ•ฉ๋‹ˆ๋‹ค. Higgs TTS 3๋Š” Boson AI๊ฐ€ 2026๋…„ 6์›” ๊ณต๊ฐœํ•œ TTS ๋ชจ๋ธ์ž…๋‹ˆ...

2026๋…„ 8์›” 8์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

[Paper Review] AEQ-Bench

AEQ-Bench (2026 ACL findings) ๋Œ€ํ™”๋ฅผ ํ•œ๋‹ค๋Š” ๊ฒƒ ์šฐ๋ฆฌ๊ฐ€ ๋Œ€ํ™”๋ฅผ ํ•  ๋•Œ ๋น„์–ธ์–ด์ ์ธ ์š”์†Œ๋“ค๋„ ๋ฌธ๋งฅ์„ ํŒŒ์•…ํ•˜๋Š”๋ฐ ๋งŽ์€ ์˜ํ–ฅ์„ ๋ผ์นœ๋‹ค. ๊ฐ™์€ ๋‚ด์šฉ์˜ ๋ฌธ์žฅ์„ ๋งํ•˜๋”๋ผ๋„ ๋‹ค๋ฅธ ํ†ค์œผ๋กœ ๋งํ•˜๋ฉด ๋‹ค๋ฅธ ๊ฐ์ •๊ณผ ์˜๋„๋ฅผ ์ „๋‹ฌํ•œ๋‹ค. ๊ทธ๋Ÿฌ๋ฉด ์‚ฌ๋žŒ์ฒ˜๋Ÿผ AI ๋ชจ๋ธ๋“ค์€ ์ด๋Ÿฌํ•œ ๋ถ€๋ถ„๋“ค์„ ์ž˜ ์บ์น˜ํ•˜๊ณ  ์žˆ์„๊นŒ? ์ตœ๊ทผ์—๋Š” ๋Œ€ํ™” ๋ชจ๋ธ์—์„œ ์ด๋Ÿฌํ•œ ๋ถ€๋ถ„์„ ํ‰๊ฐ€ํ•˜๋Š” ๋ฐฉ๋ฒ•์„ ...

2026๋…„ 8์›” 2์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

[Paper Review]ParaS2S

ParaS2S: Benchmarking and Aligning Spoken Language Models for Paralinguistic-aware Speech-to-Speech Interaction ICLR 2026 Paper link Demo audio samples Speech LLM์˜ ํ‰๊ฐ€ ๋ฐฉ๋ฒ•์„ ์ฐธ๊ณ ํ•˜๊ธฐ ์œ„ํ•ด ๊ด€๋ จ ์—ฐ๊ตฌ๋ฅผ ๊ณ„์† ์ฐพ์•„๋ณด๊ณ  ์žˆ๋‹ค. ...

2026๋…„ 7์›” 26์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

[Paper Review] Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

์ตœ๊ทผ ๋Œ€ํ™”ํ˜• ์Œ์„ฑ ๋ชจ๋ธ์— ๊ฐ•ํ™”ํ•™์Šต์„ ์ ์šฉํ•˜๋Š” ์‹คํ—˜์„ ์ค€๋น„ํ•˜๋ฉด์„œ ๊ด€๋ จ ์—ฐ๊ตฌ๋ฅผ ์ฐพ์•„๋ณด์•˜๋‹ค. ๊ทธ์ค‘ Moshi์™€ PersonaPlex์— GRPO ๊ธฐ๋ฐ˜ ๊ฐ•ํ™”ํ•™์Šต์„ ์ ์šฉํ•ด ์ƒํ˜ธ์ž‘์šฉ ์„ฑ๋Šฅ์„ ๊ฐœ์„ ํ•œ ๋…ผ๋ฌธ์ธ Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models๋ฅผ ์‚ดํŽด๋ณด์•˜๋‹ค. ์ „๋ฐ˜์ ์œผ๋กœ ์งง์€ utteranc...

2026๋…„ 7์›” 14์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

[Paper Review] OpenS2S

OpenS2S๋Š” ์‚ฌ์šฉ์ž์˜ ์Œ์„ฑ์— ๋‹ด๊ธด ์–ธ์–ด์  ๋‚ด์šฉ๊ณผ ๊ฐ์ •, ์–ต์–‘, ๋งํˆฌ ๊ฐ™์€ ์ค€์–ธ์–ด์  ์ •๋ณด๋ฅผ ์ดํ•ดํ•˜๊ณ , ์ด์— ๋งž๋Š” ๊ณต๊ฐ์  ํ…์ŠคํŠธ์™€ ๊ฐ์ •์ด ํ‘œํ˜„๋œ ์Œ์„ฑ ์‘๋‹ต์„ ์ƒ์„ฑํ•˜๋Š” ์˜คํ”ˆ์†Œ์Šค Speech-to-Speech ๋ชจ๋ธ์ด๋‹ค. ๋‹ค๋งŒ OpenS2S๋Š” ์‘๋‹ต ํ…์ŠคํŠธ๊ฐ€ ๋ชจ๋‘ ์™„์„ฑ๋˜๊ธฐ ์ „๋ถ€ํ„ฐ speech token๊ณผ waveform์„ ์ˆœ์ฐจ์ ์œผ๋กœ ์ƒ์„ฑํ•˜์ง€๋งŒ, Moshi๋‚˜ Pe...

2026๋…„ 7์›” 12์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

[Paper Review] PHOENIX-VAD: STREAMING SEMANTIC ENDPOINT DETECTION FOR FULL-DUPLEX SPEECH INTERACTION

Overview One of the most critical challenges in building a full-duplex dialogue model is achieving naturalistic turn-taking โ€” the model should know when to respond and when to keep listening. This p...

2026๋…„ 6์›” 22์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

Digging Into the Moshi Model's Code

Today I took a closer look at how the Moshi model actually works under the hood, code-wise. Moshi is fundamentally a model designed to listen and speak at the same time. Because of this, unlike typic...

2026๋…„ 6์›” 21์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

[Paper Review] DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio

How can we make a better dataset from in-the-wild data for training full-duplex models? โœ”๏ธ Background Training a full-duplex spoken dialogue model requires dialogue recordings where each speaker is o...

2026๋…„ 6์›” 13์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

PLDA์™€ Cosine Similarity ์ฐจ์ด์ 

์ตœ๊ทผ์— ํ™”์ž ๋ถ„๋ฆฌ ํƒœ์Šคํฌ๋ฅผ ๋ณด๊ณค ํ–ˆ๋Š”๋ฐ ์Œ์„ฑ ์ธ์‹, ํ™”์ž ์ธ์ฆ, ์–ผ๊ตด ์ธ์‹, ์ž„๋ฒ ๋”ฉ ๊ฒ€์ƒ‰ ๊ฐ™์€ ๋ถ„์•ผ๋ฅผ ๋ณด๋‹ค ๋ณด๋ฉด ์ž์ฃผ ๋“ฑ์žฅํ•˜๋Š” ๋น„๊ต ๋ฐฉ์‹์ด ์žˆ์Šต๋‹ˆ๋‹ค. ๋ฐ”๋กœ Cosine Similarity์™€ PLDA์ž…๋‹ˆ๋‹ค. ๋‘˜ ๋‹ค โ€œ๋‘ ๋ฒกํ„ฐ๊ฐ€ ์–ผ๋งˆ๋‚˜ ๋น„์Šทํ•œ๊ฐ€?โ€๋ฅผ ํŒ๋‹จํ•˜๋Š” ๋ฐ ์“ฐ์ด์ง€๋งŒ ์ฐจ์ด๊ฐ€ ์žˆ๊ธฐ ๋•Œ๋ฌธ์— ๊ทธ ๋ถ€๋ถ„์€ ๊ฐ„๋‹จํ•˜๊ฒŒ ์ •๋ฆฌํ•˜๊ณ ์ž ํ•ฉ๋‹ˆ๋‹ค. ๊ฒฐ๋ก ์„ ๋ฏธ๋ฆฌ ๋ง์”€ ๋“œ๋ฆฌ์ž๋ฉด,...

2026๋…„ 6์›” 7์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

์Œ์„ฑ ๋Œ€ํ™”๋ชจ๋ธ, ์š”์ฆ˜์€ ์–ด๋–ป๊ฒŒ ํ‰๊ฐ€ํ• ๊นŒ

์ตœ๊ทผ ์Œ์„ฑ ๋Œ€ํ™”๋ชจ๋ธ ์—ฐ๊ตฌ๊ฐ€ ์ •๋ง ํ™œ๋ฐœํ•˜๋‹ค. ํŠนํžˆ ์‚ฌ์šฉ์ž์˜ ๋ง์„ ๋๊นŒ์ง€ ๋‹ค ๋“ฃ๊ณ  ๋‚˜์„œ์•ผ ๋Œ€๋‹ตํ•˜๋Š” half-duplex ๋ฐฉ์‹์„ ๋„˜์–ด, ๋“ฃ๋Š” ๋™์‹œ์— ๋งํ•  ์ˆ˜ ์žˆ๋Š” full-duplex ๋ชจ๋ธ๋“ค์ด ๋น ๋ฅด๊ฒŒ ๋“ฑ์žฅํ•˜๊ณ  ์žˆ๋‹ค. ๋ผ์–ด๋“ค๊ธฐ(interruption), ๋ฉˆ์ถค(pause), ์งง์€ ๋งž์žฅ๊ตฌ(backchannel)์ฒ˜๋Ÿผ ์‚ฌ๋žŒ ์‚ฌ์ด์˜ ๋Œ€ํ™”์—์„œ ์ž์—ฐ์Šค๋Ÿฝ๊ฒŒ ์ผ์–ด๋‚˜๋Š” ํ˜„์ƒ๋“ค์„ ๋‹ค...

2026๋…„ 5์›” 31์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

๋Œ€ํ™” ๋ฐ์ดํ„ฐ์…‹ ๋ฆฌ๋ทฐ

Open-Source Full-Duplex Conversational Datasets for Natural and Interactive Speech Synthesis ๋Œ€ํ™”ํ˜• ๋ชจ๋ธ์— ๊ณ„์† ๊ด€์‹ฌ์„ ๊ฐ–๊ณ  ์žˆ๊ณ , ๋ฐ์ดํ„ฐ ํŒŒํŠธ๊ฐ€ ๊ถ๊ธˆํ•ด ์ฝ๊ฒŒ ๋˜์—ˆ์Šต๋‹ˆ๋‹ค. ๋…ผ๋ฌธ์—์„œ ์ง„ํ–‰ํ•œ ๋ฐฉ์‹์€ ์ง์ ‘ ๋…น์Œํ•˜๋Š” ๋ฐฉ์‹์ด์—ˆ๋Š”๋ฐ ์‚ฌ์‹ค ๋น„์šฉ ๋ฌธ์ œ๋กœ ํฌ๋กค๋ง์ด๋‚˜ ํ•ฉ์„ฑ์— ๋น„ํ•ด ์ œ๊ฐ€ ๋”ฐ๋ผ์„œ ์ ์šฉํ•˜๊ธฐ...

2026๋…„ 5์›” 17์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

AI EXPO 2026 ๊ตญ์ œ์ธ๊ณต์ง€๋Šฅ๋Œ€์ „ ๊ด€๋žŒ ํ›„๊ธฐ

์ฝ”์—‘์Šค์—์„œ ์ง„ํ–‰๋œ AI EXPO 2026 ์— ๋‹ค๋…€์™”์Šต๋‹ˆ๋‹ค. ํ–‰์‚ฌ์ •๋ณด ๋งํฌ ์ฝ”์—‘์Šค : https://www.coex.co.kr/exhibitions/๊ตญ์ œ์ธ๊ณต์ง€๋Šฅ๋Œ€์ „-2/ ๊ตญ์ œ์ธ๊ณต์ง€๋Šฅ๋Œ€์ „: http://www.aiexpo.co.kr/home/v4.php?s=34 ์‹œ๊ฐ„: 05/06(์ˆ˜) - 05/08(๊ธˆ) 10:00 - 17:00 ์žฅ์†Œ: ์ฝ”์—‘์Šค Hall ...

2026๋…„ 5์›” 7์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

[Paper Review] Easy Turn: Integrating Acoustic and Linguistic Modalities for Robust Turn-Taking in Full-Duplex Spoken Dialogue Systems

#Full-duplex spoken dialogue systems #turn taking detection #์Œํ–ฅ๊ณผ ์–ธ์–ด๋ฅผ ํ•จ๊ป˜ ์จ์„œ, ๋” ์ž์—ฐ์Šค๋Ÿฌ์šด ๋Œ€ํ™”๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ? โœ”๏ธ ๋ฐฐ๊ฒฝ ์ตœ๊ทผ spoken dialogue system์€ ๋‹จ์ˆœํžˆ โ€œ์งˆ๋ฌธํ•˜๋ฉด ๋Œ€๋‹ตํ•˜๋Š”โ€

2026๋…„ 5์›” 3์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

PersonaPlex ๋ฆฌ๋ทฐ

PersonaPlex: Voice and Role Control for Full Duplex Conversational Speech Models โœ”๏ธ ๋ฐฐ๊ฒฝ ์ตœ๊ทผ ์Œ์„ฑ AI๋Š” ๋‹จ์ˆœํžˆ ์ž์—ฐ์Šค๋Ÿฌ์šด ์Œ์„ฑ์„ ํ•ฉ์„ฑํ•˜๋Š” TTS๋ฅผ ๋„˜์–ด์„œ, ์‹ค์‹œ๊ฐ„์œผ๋กœ ๋“ฃ๊ณ , ๋งํ•˜๊ณ , ๋ผ์–ด๋“ค๊ณ , ๋งž์žฅ๊ตฌ์น˜๋ฉฐ, ์ƒํ™ฉ์— ๋งž๋Š” ์—ญํ• ์„ ์ˆ˜ํ–‰ํ•˜๋Š” ๋Œ€ํ™”ํ˜• ์Œ์„ฑ ์—์ด์ „ํŠธ๋กœ ๋น ๋ฅด๊ฒŒ ํ™•์žฅ๋˜๊ณ  ์žˆ์Šต๋‹ˆ๋‹ค. ํŠน...

2026๋…„ 4์›” 26์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

ํ™”์ž ๋ถ„๋ฆฌ(Speaker Diarization) ๊ธฐ์ดˆ(2) - VAD, UBM

์ž‘์„ฑ์ค‘

2026๋…„ 4์›” 13์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

[Paper Review] AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

https://arxiv.org/abs/2306.00978 ์ž‘์„ฑ์ค‘..

2026๋…„ 4์›” 11์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท
post-thumbnail

ํ™”์ž ๋ถ„๋ฆฌ(Speaker Diarization) ๊ธฐ์ดˆ (1) - MFCC

์‹œ์ž‘ํ•˜๊ธฐ ์ „์—... ์šฉ์–ด๋ฅผ ํ—ท๊ฐˆ๋ ค ํ•˜์‹ค๊นŒ๋ด spectrum, spectrogram, mel spectrogram, mfcc ์˜ ์ฐจ์ด๋ฅผ ๊ฐ„๋‹จํžˆ ์ •๋ฆฌํ•˜์ž๋ฉด ์ด์™€ ๊ฐ™์Šต๋‹ˆ๋‹ค. ์ด๋ฏธ์ง€ ์ถœ์ฒ˜ waveform โ†’ (pre-emphasis) โ†’ STFT(framing(hamming window, overlap, hop size) โ†’ ๊ฐ ํ”„๋ ˆ์ž„์— DFT(์‹ค์ œ๋กœ๋Š” ์—ฐ์‚ฐ ...

2026๋…„ 4์›” 9์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

[Paper Review] Emotion Concepts and their Function in a Large Language Model

https://transformer-circuits.pub/2026/emotions/index.html ์ž‘์„ฑ์ค‘..

2026๋…„ 4์›” 8์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท

chown โ€“ ํŒŒ์ผ ์†Œ์œ ์ž ๋ณ€๊ฒฝ

chown โ€“ ํŒŒ์ผ ์†Œ์œ ์ž ๋ณ€๊ฒฝ โœ”๏ธ ๊ธฐ๋ณธ ๊ฐœ๋… chown์€ ํŒŒ์ผ์ด๋‚˜ ๋””๋ ‰ํ† ๋ฆฌ์˜ ์†Œ์œ ์ž(owner)์™€ ๊ทธ๋ฃน(group) ์„ ๋ณ€๊ฒฝํ•˜๋Š” ๋ช…๋ น์–ด์ด๋‹ค. โœ”๏ธ ์‚ฌ์šฉ ์˜ˆ์‹œ sudo chown -R [์†Œ์œ ์ž]:[๊ทธ๋ฃน] [๋Œ€์ƒ ๋””๋ ‰ํ† ๋ฆฌ] โœ”๏ธ ์˜๋ฏธ sudo : ๊ด€๋ฆฌ์ž ๊ถŒํ•œ์œผ๋กœ ์‹คํ–‰ chown : ์†Œ์œ ์ž ๋ณ€๊ฒฝ -R : ํ•˜์œ„ ๋””๋ ‰ํ† ๋ฆฌ๊นŒ์ง€ ์žฌ๊ท€์ ์œผ๋กœ ์ ์šฉ

2026๋…„ 4์›” 7์ผ
ยท
0๊ฐœ์˜ ๋Œ“๊ธ€
ยท