배경
DCC 2026 캠프 온라인 연수원 4차시에서 오차역전파(Backpropagation)의 편미분 공식이 막혔다. 체인룰 자체는 알고 있었는데, 표기법과 여러 층·여러 출력 노드로 확장되는 부분이 헷갈렸다.
표기법부터 다시 잡기
은 활성화 함수를 통과하기 전 가중합, 은 통과한 후의 값이다.
한 층을 지날 때마다 "이전 층 출력 → 가중합(z) → 활성화(a)"가 반복된다는 걸 표기법으로 정리하고 나니, L, L-1 인덱스가 그냥 몇 번째 층인지 가리키는 번호라는 게 명확해졌다.

체인이 층을 넘어갈 때
에 대한 미분을 구하려면 이 필요한데, 은 에 직접 연결되어 있지 않고 을 거쳐서만 영향을 준다. 그래서 이미 구해둔 을 재사용해서 한 항만 더 곱하는 식으로 확장한다.
매번 처음부터 다시 계산하는 게 아니라 이전 결과에 항을 하나씩 이어붙이는 구조라는 걸 알고 나니 "역전파"라는 이름이 왜 붙었는지 이해가 됐다.

경로가 여러 개면 더한다
은닉층 뉴런 하나가 출력 노드 여러 개에 동시에 연결되어 있을 때는 한 줄 곱셈으로 끝나지 않는다. 각 출력 경로에서 계산한 값을 전부 더해야 한다. 정리하면 규칙은 두 가지뿐이다: 한 경로 위에서는 곱하고, 경로가 갈라지면 더한다.

CNN — MLP와 다른 이유
5차시로 넘어가 CNN을 봤다. 이미지를 flatten해서 MLP에 넣으면 공간 정보가 사라지고 파라미터 수도 폭증한다. CNN은 필터를 이미지 전체에 재사용(가중치 공유)해서 지역 특징을 뽑아내며 이 문제를 피한다.
Convolution과 ResNet
Convolution은 필터를 슬라이드하며 겹치는 위치의 원소를 곱해서 더하는 연산이다. Stride로 이동 간격을, Padding으로 출력 크기를 조절한다.

ResNet의 skip connection이 처음엔 "x를 그대로 더한다"는 게 이해가 안 됐는데, 정리하고 보니 4차시에서 배운 "경로가 갈라지면 더한다"는 패턴과 구조가 같았다. 각 블록은 직전 블록의 출력에 자기만의 변화량 만 학습해서 더하는 걸 반복한다.
크기가 절반으로 줄어드는 전환 지점에서는 skip 경로의 에도 1×1 conv()를 적용해 모양을 맞춘 뒤 더한다.

다음 계획
6~8차시(NLP, 오디오 특징 추출, 오디오 딥러닝)를 마저 정리하고, Mission 1(성별 분류)·Mission 3(증상 분류)에 실제로 어떤 접근을 쓸지 실험을 시작할 예정이다.