강의 / 우리는 모두 같은 AI를 쓰고 있다 / 7강
시작 …
AI 심사자는 사람보다 서로 닮은 리뷰를 쓰고, 내용을 바꾸지 않고 문장만 고쳐도 점수가 올라갑니다. 두 가지 필요조건을 통과하지 못하면 자동화를 멈추자는 논문입니다.
시리즈의 마무리입니다.
앞 편들이 다룬 동질성이 학계 운영에 들어왔을 때 무슨 일이 생기는지를 봅니다. 논문 심사에 AI가 들어오고 있고, 이미 여러 학회가 정책을 만들고 있습니다.
논문은 AI 심사를 도입하기 전에 통과해야 할 조건 두 가지를 제시합니다.
둘 다 충분조건이 아니라 필요조건입니다. 이것을 통과해도 좋은 심사라는 보장은 없지만, 통과하지 못하면 쓰면 안 된다는 뜻입니다.
| 측정 | 사람 | AI |
|---|---|---|
| 리뷰 내부 유사도 | 0.811 | 0.882 |
| 심사자 사이 점수 상관 | 0.15 (AI와 사람) | 0.49 (AI끼리) |
| 채택 예측력 | 0.822 | 0.710 |
ICLR 2026 리뷰 75,800건을 분석했을 때 AI 생성 리뷰 사이의 유사도는 0.486, 나머지는 0.467입니다.
AI 심사자끼리의 점수 상관이 0.49라는 것은 여러 명을 붙여도 사실상 한 명을 여러 번 부른 것에 가깝다는 뜻입니다. 심사에서 여러 명을 두는 이유가 서로 다른 관점을 얻기 위해서라는 점을 생각하면 문제입니다.
세 가지를 기억하시면 됩니다.
이 시리즈를 여기서 마칩니다. 같은 답을 내놓는 모델들, 그 안쪽에서 벌어지는 일을 논문 7편으로 따라갔습니다.
1강과 2강에서 현상과 처방을 보았고, 3강부터 5강까지 표현이 수렴한다는 가설과 그것을 이용하는 방법을 다루었습니다. 6강에서 반대편 증거를 확인했고, 7강에서 이 동질성이 학계로 번졌을 때 생기는 일을 보았습니다.
다음 시즌에서는 이 흐름을 방어 쪽에서 다시 봅니다.
로그인하시면 댓글을 쓰실 수 있습니다.
아직 댓글이 없습니다. 첫 댓글을 남겨 주시면 됩니다.