강의 / 우리는 모두 같은 AI를 쓰고 있다
논문 7편으로 파헤치는 AI 동질화
서로 다른 회사가 만든 모델들에 같은 질문을 던지면 답이 서로 닮아 갑니다. 그 동질성을 실제로 측정한 논문입니다.
모델에게 답 하나가 아니라 답의 분포를 말로 내놓게 하면 다양성이 상당 부분 돌아온다는 주장입니다.
구조도 목적도 다루는 자료도 다른 모델들이 데이터 사이의 거리를 점점 비슷하게 재고 있다는 주장입니다.
같은 모델을 두 번 학습하면 좌표는 달라지지만 각도는 남습니다. 모든 점을 앵커와의 유사도로 바꾸면 서로 다른 모델의 부품을 학습 없이 이어 붙일 수 있습니다.
짝지어진 데이터도, 인코더 접근도 없이 한 모델의 임베딩을 다른 모델의 공간으로 옮길 수 있고, 그것만으로 문서 내용의 일부가 새어 나옵니다.
정렬이 커진다는 결과는 후보 집합이 작아서 생긴 착시일 수 있습니다. 후보를 1,024개에서 1,500만 개로 키우면 정렬은 거의 사라집니다.
AI 심사자는 사람보다 서로 닮은 리뷰를 쓰고, 내용을 바꾸지 않고 문장만 고쳐도 점수가 올라갑니다. 두 가지 필요조건을 통과하지 못하면 자동화를 멈추자는 논문입니다.