배경
DCC 2026 Mission 1은 119 신고 통화 음성에서 신고자 성별을 분류하는 문제다. 데이터는 Google Drive에 Training 29,200건, Validation 3,640건으로 제공됐고, 라벨링 json에는 발화자별 speaker, startAt/endAt, 세션 단위 gender가 들어있다.
베이스라인은 신고자(speaker == 1) 구간만 잘라내 Mel-spectrogram + 소형 CNN으로 학습하는 구조로 잡았다. 문제는 모델이 아니라 그 앞 단계, 전처리에서 터졌다.
문제 발견: Drive I/O 병목
manifest(wav-json 매칭, 발화 구간 정리)까지는 큰 문제가 없었다. 문제는 그다음, 학습용 오디오를 실제로 잘라내는 단계였다.
Dataset.__getitem__에서 매 스텝마다 soundfile로 Drive 마운트 경로의 wav를 직접 읽었는데, 배치 20개를 처리하는 데 8분 46초가 걸렸다. 배치당 약 26초 — GPU 연산으로는 나올 수 없는 속도였다. Google Drive는 FUSE로 마운트되기 때문에 파일을 열 때마다 네트워크 왕복이 발생하고, 이게 스텝마다 누적되면서 10 epoch 기준 60시간대까지 나왔다.