본문 바로가기
전공/Speech

디먹스(Demucs)에 대하여

by import ysy 2026. 9. 7.

안녕하세요, import ysy입니다.

 

음성 데이터 다루다 보면 디먹스라는 용어가 계속 등장하는데, 

대충은 알 것 같은데 개념이 계속 헷갈려서 정리를 해보려 합니다.


 

오디오 분야에서 Demucs(디먹스)는

Meta AI(FAIR)에서 개발한 음원 분리(Music Source Separation) 모델 시리즈를 말합니다.

 

하나의 혼합된 오디오 파일(마스터 음원)을 입력받아

보컬, 드럼, 베이스, 기타 악기(Other)

각각의 독립된 오디오 트랙으로 분리해내는 신경망입니다.

 

 

https://docs.pytorch.org/audio/2.1/tutorials/hybrid_demucs_tutorial.html

 

Demucs 오디오 분리 처리 흐름을 나타낸 이미지입니다.

PyTorch documentation에서 가져왔어요.

 

Demucs 계열 모델의 발전

Demucs는 시간 영역(Waveform)과 주파수 영역(Spectrogram)을 처리하는

하이브리드 구조 및 트랜스포머 기술을 도입하면서 발전해 왔습니다.

 

아래와 같이 꽤 여러 종류가 있고 시간에 따라 발전했습니다.

  • Demucs (v1 / v2): Conv1D 기반 U-Net 구조를 사용해 타임 도메인의 파형을 직접 처리하는 방식
  • Hybrid Demucs (v3): 주파수 스펙트로그램 처리 축과 타임 도메인 파형 처리 축을 함께 결합해 음원 분리 정확도를 끌어올림
  • HTDemucs (Hybrid Transformer Demucs / v4): Hybrid Demucs 구조에 Cross-Domain Transformer 레이어를 추가한 모델, 시간과 주파수 데이터 간의 장기 의존성(Long-range dependency)을 학습하여 악기 간 잔향이나 미세한 음역대 간섭을 한층 깔끔하게 분리

 

그래서 어디에 쓰는 모델인데?

  • MR / MR 제거 음원 생성: 보컬 트랙만 추출하거나 제거하여 반주 트랙 생성
  • 전처리(Pre-processing): 잡음이 포함된 복합 오디오에서 Target 음성이나 보컬 영역만 선택적으로 전처리할 때 활용
  • 스템(Stems) 추출: 리믹스, 샘플링, 오디오 데이터셋 정제용 Stem 파일 분리

디먹스(Demucs) 이름의 유래

  • 회로의 Demux: 1개의 신호를 여러 개로 나누는 장치
  • Meta AI의 Demucs: 1개의 혼합 오디오(마스터 음원)를 보컬, 드럼, 베이스 등 여러 트랙으로 나누는 AI 모델

즉, Meta에서 오디오 분리 역할을 표현하기 위해 디멀티플렉서에서 이름을 따와 Demucs라고 지은 것입니다.

전자공학의 신호처리 분야에서 떨어져 나와 용어가 굳어진 셈이죠.

 

오디오 분야에서 "디먹스"의 위상

오디오 처리나 음원 분리 분야에서

"디먹스"라는 단어는 고유명사이자 대표 모델명으로 사용됩니다.

  • 표준 오픈소스 모델: 오디오 분리(Source Separation) 분야에서 SOTA(State-of-the-Art) 성능을 내는 표준적인 모델
  • 업계 용어화: 오디오 엔지니어링이나 AI 오디오 처리 연구진 사이에서 "음원 분리 처리한다"는 말을 "디먹스 돌린다"라고 표현

근데 때로는 단순 모델이 아니다.

저도 이 부분 때문에 정말 헷갈렸는데요!

일반적으로 AI 모델을 칭하기는 하지만, 

데이터를 다룰 때는 또 다르게 사용하기도 해서 

아래와 같이 두 가지 상황에 잘 사용을 하시면 좋을 것 같습니다.

 

  • 미디어 포맷/스트리밍 레벨: Demux / Demuxing
    • 동영상(MKV, MP4)에서 오디오 트랙과 비디오 트랙을 개별 데이터 스트림으로 나눠내는 파일 파싱/스트림 분리 작업을 의미합니다. (MP4 Parser / Demuxer)
  • 음원 분리 AI 레벨: Meta AI의 Demucs
    • 혼합 오디오에서 보컬, 드럼, 베이스 등 음향 소스를 분리해내는 AI 모델을 의미합니다.

 

이렇게 오늘은 은근 자주 쓰이지만 

알듯말듯 헷갈리는 용어

디먹스에 대해 정리해봤습니다.

 

궁금한 점은 댓글 달아주세요!

 

반응형

'전공 > Speech' 카테고리의 다른 글

음성 Source-Filter Model  (0) 2026.08.12

댓글