AI Researcher in Audio Deepfake Detection
오디오 딥페이크 탐지 · 음원 분리 · 설명 가능한 AI
현재 복합 오디오 위변조 탐지 연구를 진행 중입니다.
기존 모델이 "진짜/가짜" 이진 판별에 그치는 것과 달리, 음성과 환경음을 분리하여 "어느 채널이 가짜인가" 를 5개 클래스로 설명하는 프레임워크를 제안합니다.
관심 연구 분야
- 오디오 딥페이크 탐지 (Audio Anti-Spoofing)
- 음원 분리 (Blind Source Separation)
- 설명 가능한 AI (Explainable AI, XAI)
- 음성/오디오 신호 처리
음원 분리 + 물리 음향 피처 기반 5-class 복합 오디오 위변조 탐지 시스템
| 항목 | 내용 |
|---|---|
| 데이터셋 | CompSpoofV2 (24,864 samples, 5-class) |
| 핵심 모델 | Conv-TasNet (음원 분리) + LightGBM (19-dim 물리 피처) |
| Accuracy | 69.8% · Macro-F1 0.6564 |
| FAKE Recall | 56.4% (SuDORM-RF 대비 +41%p 개선) |
| 논문 | 정보처리학회 논문 작성 중 (2026) |
핵심 기여
- 사전학습 없이 물리 음향 지표(RT60, Noise Floor, MSC, XCorr)만으로 경쟁력 있는 탐지 성능 달성
- SI-SNR ↔ FAKE recall 비선형 상관관계 정량 실증
- LightGBM Feature Importance를 통한 판정 근거 시각화
[입력 오디오]
│
[LCNN-SE Gatekeeper] → REAL 조기 판정
│
[Conv-TasNet 음원 분리]
├── 🗣️ Speech Stream → WavLM 위조 점수
└── 🌿 Env Stream → LCNN-SE 위조 점수
│
[물리 음향 분석: RT60 · Noise Floor · MSC · XCorr]
│
[LightGBM 5-class] → REAL / GENUINE / SPOOF_SPEECH / SPOOF_ENV / FAKE
| 상태 | 제목 | 학술대회 |
|---|---|---|
| 투고 | S-CAD: 음원 분리 기반 복합 오디오 위변조 5-class 탐지 | 정보처리학회 2026 하계학술대회 |
| 투고 | PAR : 경량 환경 기반 멀티 에이전트 이미지 판정 기법 | 정보처리학회 2026 하계학술대회 |
- Email: [email protected]
- Blog: velog.io/@dydtn61498

