강의 / 우리는 모두 같은 AI를 쓰고 있다 / 5강
시작 …
짝지어진 데이터도, 인코더 접근도 없이 한 모델의 임베딩을 다른 모델의 공간으로 옮길 수 있고, 그것만으로 문서 내용의 일부가 새어 나옵니다.
현업의 고민에서 시작하겠습니다.
얼굴 편집 기능 하나를 만드는 데 모델이 네다섯 개 붙습니다. 검출 모델, 임베딩 모델, 편집 모델, 품질 판정 모델. 각각 다른 회사가 만들었고 공간도 전부 다릅니다.
4강의 방법은 앵커로 쓸 짝지어진 데이터가 필요했습니다. 이번 논문은 그것조차 없을 때를 다룹니다.
세 번째가 보안 문제로 이어집니다.
부품을 나눠 보면 이렇습니다.
벡터 하나가 지나가는 경로는 네 가지입니다. 자기 자신으로 돌아오는 경로, 상대 공간으로 가는 경로, 갔다가 돌아오는 경로, 상대 공간 안에서만 도는 경로. 손실 함수도 이 네 경로에 각각 붙습니다.
| 지표 | 값 | 무작위 수준 |
|---|---|---|
| 코사인 유사도 | 최대 0.92 | 0에 가까움 |
| Top-1 정확도 | 최대 1.00 | 0.0001 |
| 평균 순위 | 1 | 4,096 |
후보가 8,192개인 상황에서 무작위로 찍으면 평균 순위가 4,096위입니다. 번역된 임베딩은 1위로 맞힙니다.
엔론 이메일 데이터셋에서는 최대 80%가 내용이 새어 나온 것으로 판정되었습니다.
학습 데이터는 모델마다 100만 문장을 썼습니다. 다만 5만 문장만으로도 거의 같은 성능이 나옵니다.
논문 전체 학습에 약 176 GPU일이 들었습니다. 재현하기에 부담스러운 규모는 아닙니다.
세 번째가 실무에서 제일 중요합니다. 임베딩을 평문처럼 다루고 계셨다면 접근 권한을 다시 보셔야 합니다.
로그인하시면 댓글을 쓰실 수 있습니다.
아직 댓글이 없습니다. 첫 댓글을 남겨 주시면 됩니다.