목차 들어가며앞의 네 편은 전부 소리만 다루는 모델이었다.첫 편은 성능 표의 dB가 무엇을 재는지 물었고 그 답이 SI-SDR(scale-invariant signal-to-distortion ratio, 스케일 불변 신호 대 왜곡 비)이었다.두 번째 편은 그 지표로 학습한 Conv-TasNet에서 인코더와 분리기와 디코더로 이어지는 3단 골격을 확인했다.세 번째 편은 그 골격을 유지한 채 분리기의 복잡도를 열한 배 줄인 TDANet을 읽었고, 네 번째 편은 화자를 나누는 위치를 앞당긴 SepReformer를 읽었다.이번 논문은 그 골격에 입술 영상을 붙인다. 시청각 음성 분리(audio-visual speech separation, AVSS)를 표방한 이 시리즈에서 영상이 실제로 들어오는 첫 편이다.논..
ML+DL/Paper Note
2026. 8. 22. 19:20
공지사항
최근에 올라온 글
최근에 달린 댓글
- Total
- Today
- Yesterday
링크
TAG
- a6000
- 칼이사
- 세계일주
- 지지
- 기술면접
- 리스트
- Python
- java
- 알고리즘
- 자바
- 중남미
- 스트림
- 면접 준비
- 맛집
- 유럽
- Algorithm
- 파이썬
- 딥러닝
- 여행
- 백준
- spring
- BOJ
- 세계여행
- 동적계획법
- 야경
- 남미
- 스프링
- RX100M5
- 세모
- 유럽여행
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
글 보관함
