목차 들어가며앞의 다섯 편은 지표와 골격과 비용과 분리 위치, 그리고 영상 인코더를 차례로 다뤘다.첫 편은 성능 표의 dB가 무엇을 재는지 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet에서 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했고, 세 번째 편은 그 골격을 유지한 채 분리기를 열한 배 줄인 TDANet을, 네 번째 편은 화자를 나누는 위치를 앞당긴 SepReformer를 읽었다.다섯 번째 편의 Dolphin은 그 골격에 입술 영상을 붙였고, 결론에서 자기 한계를 적으면서 깨끗하고 소리와 잘 맞물린 입술 영상을 전제한다고 밝혔다.이번 논문은..
목차 들어가며앞의 네 편은 전부 소리만 다루는 모델이었다.첫 편은 성능 표의 dB가 무엇을 재는지 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet에서 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했다.세 번째 편은 그 골격을 유지한 채 분리기의 복잡도를 열한 배 줄인 TDANet을 읽었고, 네 번째 편은 화자를 나누는 위치를 앞당긴 SepReformer를 읽었다.이번 논문은 그 골격에 입술 영상을 붙인다. 시청각 음성 분리(audio-visual speech separation, AVSS)를 표방한 이 시리즈에서 영상이 실제로 들어오는 첫 편이다.논..
목차 들어가며앞의 세 편은 지표와 골격과 비용을 차례로 다뤘다.첫 편은 성능 표의 dB가 무엇을 재고 있는지를 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet을 읽고 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했다.세 번째 편은 그 골격을 유지한 채 분리기의 복잡도를 열한 배 줄인 TDANet을 읽었다.이번 논문은 방향이 반대다. 효율을 지키면서도 wsj0-2mix의 숫자를 이 계열 최고 구간으로 밀어 올린 쪽이다.바꾼 것은 분리기 안에서 화자를 나누는 위치 하나다. 대부분의 모델이 마지막 단계에서 화자별 특징을 만드는데, 이 논문은 그 분리를 인..
- Total
- Today
- Yesterday
- 칼이사
- 스프링
- Algorithm
- 중남미
- 파이썬
- 세모
- 동적계획법
- 맛집
- spring
- 백준
- 지지
- a6000
- 야경
- 딥러닝
- 세계여행
- RX100M5
- 알고리즘
- 스트림
- 기술면접
- 리스트
- java
- 세계일주
- 유럽
- 면접 준비
- Python
- 유럽여행
- BOJ
- 자바
- 여행
- 남미
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
