목차 들어가며얼굴 인식 모델을 만들 때 가장 먼저 떠오르는 선택지는 백본을 더 깊게 쌓는 것이다.그런데 2015년에서 2019년 사이 이 분야의 성능을 실제로 끌어올린 것은 백본이 아니라 손실 함수였다.같은 ResNet에 어떤 손실 함수를 붙이느냐에 따라 AgeDB-30 정확도가 88.72퍼센트에서 95.15퍼센트까지 벌어진다.ArcFace는 그 계보의 매듭에 해당하는 논문이다. SphereFace와 CosFace가 각각 다른 자리에 넣던 마진을 하나의 식으로 묶어 정리했고, 그중 각도에 직접 더하는 방식이 가장 낫다는 것을 열 개가 넘는 벤치마크로 보였다.이 글은 그 손실 함수가 무엇을 하는지 수식에서 시작해 코드까지 따라가고, 논문이 적은 숫자를 직접 돌려 확인한다.기준 판본은 arXiv:1801.0..
목차 들어가며앞의 다섯 편은 지표와 골격과 비용과 분리 위치, 그리고 영상 인코더를 차례로 다뤘다.첫 편은 성능 표의 dB가 무엇을 재는지 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet에서 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했고, 세 번째 편은 그 골격을 유지한 채 분리기를 열한 배 줄인 TDANet을, 네 번째 편은 화자를 나누는 위치를 앞당긴 SepReformer를 읽었다.다섯 번째 편의 Dolphin은 그 골격에 입술 영상을 붙였고, 결론에서 자기 한계를 적으면서 깨끗하고 소리와 잘 맞물린 입술 영상을 전제한다고 밝혔다.이번 논문은..
목차 들어가며앞의 네 편은 전부 소리만 다루는 모델이었다.첫 편은 성능 표의 dB가 무엇을 재는지 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet에서 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했다.세 번째 편은 그 골격을 유지한 채 분리기의 복잡도를 열한 배 줄인 TDANet을 읽었고, 네 번째 편은 화자를 나누는 위치를 앞당긴 SepReformer를 읽었다.이번 논문은 그 골격에 입술 영상을 붙인다. 시청각 음성 분리(audio-visual speech separation, AVSS)를 표방한 이 시리즈에서 영상이 실제로 들어오는 첫 편이다.논..
목차 들어가며앞의 세 편은 지표와 골격과 비용을 차례로 다뤘다.첫 편은 성능 표의 dB가 무엇을 재고 있는지를 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet을 읽고 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했다.세 번째 편은 그 골격을 유지한 채 분리기의 복잡도를 열한 배 줄인 TDANet을 읽었다.이번 논문은 방향이 반대다. 효율을 지키면서도 wsj0-2mix의 숫자를 이 계열 최고 구간으로 밀어 올린 쪽이다.바꾼 것은 분리기 안에서 화자를 나누는 위치 하나다. 대부분의 모델이 마지막 단계에서 화자별 특징을 만드는데, 이 논문은 그 분리를 인..
목차 들어가며앞의 두 편은 각각 지표와 골격을 다뤘다. 첫 편은 성능 표의 dB가 무엇을 재고 있는지를 물었고, 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다. 두 번째 편은 그 지표를 손실 함수로 삼아 학습한 Conv-TasNet을 읽었고, 인코더와 분리기와 디코더로 이어지는 3단 골격이 이후 시간 영역 모델의 기본형이 되었다는 것을 확인했다. 이번 논문은 그 골격을 그대로 두고 가운데의 분리기만 바꾼다. 바꾼 이유가 정확도가 아니라 복잡도라는 점이 이 논문의 성격을 결정한다. Conv-TasNet 이후 몇 년 동안 wsj0-2mix의 숫자는 빠르게 올라갔지만, 그 대가로 모델은 5.1M에서 26M, 55M으로 ..
목차 들어가며이전 논문은 이 분야의 성능 표에 적힌 dB가 무엇을 재고 있는지를 물었다. [AVSS]SDR – Half-baked or Well Done? (10.1109/ICASSP.2019.8683855) [AVSS]SDR – Half-baked or Well Done? (10.1109/ICASSP.2019.8683855)목차 들어가며음원 분리(source separation)와 음성 향상(speech enhancement) 분야의 논문은 거의 예외 없이 dB 단위의 성능 표를 싣는다. 그 표에서 0.5 dB 차이가 나면 새 방법이 기존 방법을 이겼다고 주장gnidinger.tistory.com 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케..
목차 들어가며음원 분리(source separation)와 음성 향상(speech enhancement) 분야의 논문은 거의 예외 없이 dB 단위의 성능 표를 싣는다. 그 표에서 0.5 dB 차이가 나면 새 방법이 기존 방법을 이겼다고 주장한다. 2018년에 나온 이 논문은 그 주장 방식 자체를 문제 삼는다. 저자들의 결론은 단순하다. 당시 널리 쓰이던 SDR 측정 도구가 알고리즘마다 정답을 다르게 고쳐 쓰고 있었고, 따라서 그 표의 숫자들은 서로 비교할 수 있는 값이 아니었다는 것이다. 논문의 본문은 4쪽이고 수식은 열한 개다. 분량으로 보면 가벼운 논문이지만, 이 논문이 제안한 SI-SDR은 이후 시간 영역 분리 모델의 표준 학습 손실이자 표준 평가 지표가 되었다. Conv-TasNet 이후 등장한 ..
- Total
- Today
- Yesterday
- 백준
- 칼이사
- 리스트
- 기술면접
- 맛집
- 여행
- java
- Algorithm
- BOJ
- 중남미
- 야경
- a6000
- 유럽여행
- 알고리즘
- 자바
- Python
- 스프링
- 세계일주
- 세모
- RX100M5
- 지지
- 남미
- 스트림
- 파이썬
- 동적계획법
- 면접 준비
- 딥러닝
- 세계여행
- 유럽
- spring
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
