강의 / 우리는 모두 같은 AI를 쓰고 있다 / 6강
시작 …
정렬이 커진다는 결과는 후보 집합이 작아서 생긴 착시일 수 있습니다. 후보를 1,024개에서 1,500만 개로 키우면 정렬은 거의 사라집니다.
3강의 주장을 정면으로 흔드는 편입니다.
같은 지표를 쓰되 조건 하나만 바꿔서 다시 잽니다. 그러면 결론이 달라집니다. 논문이 바꾼 조건은 후보 집합의 크기입니다.
상호 최근접 이웃 지표를 다시 정의해 보겠습니다.
데이터 하나에 대해 양쪽 모델에서 이웃 k개를 뽑고 교집합을 셉니다. 여기까지는 3강과 같습니다.
문제는 후보가 몇 개인 풀에서 이웃을 뽑느냐입니다. 후보가 1,024개면 k를 10으로 잡았을 때 우연히 겹칠 확률이 이미 상당합니다. 후보를 늘리면 그 우연 수준이 급격히 떨어집니다.
| 조건 | 후보 1,024개 | 후보 1,500만 개 |
|---|---|---|
| 이웃 수 10 | 0.135 | 0.008 |
| 이웃 수 1 | 0.058 | 0.001 |
거의 사라집니다.
중요한 확인이 하나 더 있습니다. 같은 모델 쌍의 단일 모달 정렬은 같은 규모에서 0.59에서 0.62로 안정적입니다. 지표 자체가 무너진 것이 아니라는 뜻입니다. 교차 모달 정렬만 사라집니다.
갤러리가 빽빽해질수록 느슨한 일치는 46.1%와 58.0%까지 오릅니다. 그런데 엄격한 일치는 11% 근처에서 평평합니다.
비슷한 것이 많아지면 대충 맞히기는 쉬워지지만 정확히 맞히기는 그대로라는 뜻입니다.
논문이 내놓는 대안적 해석입니다. 각 모달리티는 고유하고 일관된 자기 세계를 만든다는 관점입니다.
이미지 모델은 이미지의 세계를, 텍스트 모델은 텍스트의 세계를 만듭니다. 두 세계가 하나로 수렴하는 것이 아니라 각자 자기 안에서 일관되게 조직됩니다.
로그인하시면 댓글을 쓰실 수 있습니다.
아직 댓글이 없습니다. 첫 댓글을 남겨 주시면 됩니다.