Huggingface Speech To Speech – 오픈소스 모델로 로컬 음성 에이전트를 만드는 파이프라인

작성자

카테고리:

← 피드로
GeekNews · xguru · 2026-08-22 개발(SW)

사용자가 말하면 이를 감지하고(VAD) → 음성을 텍스트로 바꾸고(STT) → LLM이 질문을 이해하고 답변 생성 → 생성된 답변을 다시 음성으로 읽어주는(TTS) 완전한 음성 대화 파이프라인을 로컬에서 구성할 수 있음 각 단계는 각각 별도 스레드에서 동작하고 큐로 연결돼, 한 단계가…

원문 보기 ↗

출처: news.hada.io · https://news.hada.io/topic?id=32753