참석 및 진행 상황
구동한님은 불참. 나머지 팀원 상황을 공유했다.
이주호님은 온라인연수원 강의를 완료했고, 모델은 랜덤포레스트로 진행 중이다. 계다연님은 강의가 1개 남았고, 모델은 아직 미정이지만 AdaBoost로 갈 계획이라고 했다.
이주호님 전처리 방식
정답 라벨(gender)을 먼저 확보한 뒤, speaker == 1(신고자) 구간을 전부 세그먼트로 분리하고, 그 세그먼트들에 대한 성별 정답 파일을 첫 코드 단계에서 만든다. 특징 추출은 MFCC.
CNN + raw waveform 캐싱 대신 MFCC 같은 저차원 특징을 초반에 뽑아버리는 구조라, 내가 겪은 Drive I/O 병목과 저장 용량 문제를 상대적으로 덜 겪었을 가능성이 있다. 실제로 오늘 나온 얘기 중 가장 눈에 띄었던 게, 다른 팀원들은 전처리가 그렇게 오래 걸리지 않았다는 부분이었다.
결정된 사항
- -Mission 2부터는 파일 하나에 여러 명이 역할을 나눠서 작업
- -멘토링 게시판 질문은 금요일에 정하기로 함
- -9월 안에 전체 내용 마무리를 목표로 잡음
- -회의 시간 고정 필요 — 동한님과 별도로 이야기하기로 함
- -다른 팀원 코드를 참고해서 내 전처리 파이프라인 최적화하기로 함
다음 회의까지 할 일
- -이주호님 코드(랜덤포레스트 + MFCC + speaker 세그먼트 라벨링)와 내 shard 파이프라인을 비교해서, 왜 내 쪽만 오래 걸렸는지 원인 파악
- -비교 결과를 바탕으로 전처리 최적화 (필요하면 MFCC 같은 경량 특징 추출로 전환도 검토)
- -Mission 2 역할 분담을 위해 어떤 파트를 맡을지 미리 정리
- -멘토링 게시판에 올릴 질문 초안 준비
- -9월 마감에 맞춘 개인 일정 재점검