미션별 진행 상황
동한님이 미션1·2 데이터를 새 Drive로 이전하는 작업을 진행 중이다. 미션2도 WavLM 방식을 그대로 가져가서, mel-spectrogram 같은 가공 없이 음성 원형을 바로 모델에 넣는 구조로 전처리했다. WavLM으로 돌려본 결과 약 89%가 나왔는데 미션1보다는 낮은 수치다.
주호님은 미션3 모델링을 완성했고, 미션2는 전처리 파일이 준비되는 대로 진행할 예정이다. Epoch 3회 중 가장 좋은 결과는 F1 score 0.5756. 미션1에서 팀원별로 4가지 방식을 시도했을 때 동한님 모델의 accuracy가 가장 높았어서, 미션2도 그 방식을 가져와 진행 중이다.
다연님은 데이터 3만 건에 3 epoch를 시도했지만 학습이 잘 안 되는 상황이다. F1 score 0.41이고 두통 클래스는 하나도 못 맞추고 있다.
나는 미션2에서 CNN 등을 진행하게 될 경우 mel-spectrogram 가공이 필요해서 그 작업을 맡을 준비를 하기로 했고, 별도로 미션3 전처리 규정 위반 이슈(라벨링데이터 사용범위)를 재확인하고 대응을 완료했다.
미션3 — 특정 클래스 완전 실패 문제
미션3에서 가장 눈에 띄는 이슈는 주호님 모델과 다연님 모델이 각각 다른 클래스에서 F1=0을 기록했다는 것이다.
- -주호님 모델: 오심 클래스 0건 정답, 두통은 비교적 양호
- -다연님 모델: 두통 클래스를 전혀 못 맞춤
원인을 파악하기 위해 데이터를 조사해봤더니, 9개 타겟 증상의 관련 키워드가 텍스트에 실제로 등장하는 비율이 전체의 30%에 불과했다. 나머지 70%는 라벨은 붙어있지만 해당 증상 단어가 텍스트에 직접 나오지 않는 상태다. 예를 들어 "두통" 라벨이 있는 통화에서 실제로 "두통"이나 "머리가 아프다"는 표현이 나오지 않고, "혈압이 높다", "말이 어눌하다" 같은 간접 증상만 기록되어 있는 경우가 대부분이었다.
이건 AI-Hub 라벨러가 의료 프로토콜에 따라 증상 조합을 종합 판단해서 라벨을 붙인 결과로 보인다. 단순 키워드 매칭으로는 이 과제를 풀 수 없다는 뜻이고, 모델이 문맥에서 증상을 추론해야 하는 난이도 높은 문제라는 걸 확인했다.
다만 열상(F1 0.87), 복통(F1 0.80)처럼 잘 맞추는 클래스도 있어서 "텍스트만으로 증상을 맞추는 것 자체가 불가능하다"는 뜻은 아니다. 오심·두통이 유독 실패하는 원인을 전처리와 모델 양쪽에서 더 조사할 필요가 있다.
다음 일정
9월 19일 토요일 14시~14시 50분 멘토링이 예정되어 있고, 그 전까지 각자 진행 상황을 노션에 간단히 정리해두기로 했다.