목차 들어가며5부는 입술 움직임을 시퀀스로 표현하고 모델링하는 방법까지 다뤘다. 그 시퀀스를 넣으면 무엇이 나오는가가 이 편의 주제다. 같은 입술 영상에서 완전히 다른 두 가지 출력이 나올 수 있는데, 하나는 무엇을 말했는지이고 다른 하나는 누가 말했는 지다. 전자를 립리딩 또는 VSR(Visual Speech Recognition)이라 부르고, 후자는 음성 쪽의 화자 검증 구조를 그대로 빌려온다. 이 글은 두 축을 따로 세운 뒤, 비밀단어 방식이 왜 둘을 한 번에 통과시키는 설계인지를 정리한다. 한국어가 영어와 다른 문제를 낸다는 점도 별도로 다루는데, 국내 서비스를 만든다면 이 차이가 곧 설계 조건이 되기 때문이다.하나의 입술 영상에 두 개의 질문이 들어 있다무엇을 말했는가와 누가 말했는가는 다른 태..
목차 들어가며4부까지의 파이프라인은 얼굴 한 장을 임베딩 벡터 하나로 바꾸는 것으로 끝났다. 이 편부터는 입력이 한 장이 아니라 여러 프레임으로 이어진 영상이 된다. 입술 움직임은 정지된 형태가 아니라 시간에 따른 변화 자체가 정보이기 때문이다. 이 글은 입술을 숫자로 만드는 두 가지 방식과 그 전처리, 그리고 시퀀스를 다루는 신경망 구조를 정리한다. 신체 키포인트 시퀀스를 다뤄본 경험이 있다면 여기서 상당 부분이 그대로 옮겨온다. 마지막으로 이 태스크의 현재 성능 수준을 수치로 확인하는데, 기대보다 훨씬 어려운 문제라는 점이 드러난다.얼굴은 한 장으로 되지만 입술은 안 된다프레임 한 장에는 움직임 정보가 들어 있지 않다얼굴인식은 사진 한 장만 있으면 성립하는 태스크다. 얼굴의 생김새는 시간에 따라 변하..
- Total
- Today
- Yesterday
- 여행
- 딥러닝
- 스프링
- 중남미
- 유럽
- 남미
- spring
- RX100M5
- Algorithm
- a6000
- 세계여행
- 세계일주
- 스트림
- 파이썬
- 기술면접
- 동적계획법
- 세모
- java
- 지지
- 면접 준비
- 자바
- 유럽여행
- 칼이사
- 야경
- BOJ
- 맛집
- 백준
- 리스트
- Python
- 알고리즘
| 일 | 월 | 화 | 수 | 목 | 금 | 토 |
|---|---|---|---|---|---|---|
| 1 | ||||||
| 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| 9 | 10 | 11 | 12 | 13 | 14 | 15 |
| 16 | 17 | 18 | 19 | 20 | 21 | 22 |
| 23 | 24 | 25 | 26 | 27 | 28 | 29 |
| 30 | 31 |
