AI 챗봇은 정보를 환각화하고 때로는 사용자가 틀렸을 때에도 사용자의 의견에 동의하는 습관이 잘 문서화되어 있습니다. 새로운 연구에 따르면 단순히 대답을 거부하면 문제가 더 악화될 수 있다는 사실이 밝혀졌습니다.
애리조나대학교 연구진은 7개의 AI 모델을 테스트했습니다.GPT-3.5, GPT-4o, GPT-4o-mini, Claude 3.5 Sonnet, Gemini 1.5 Pro, Llama 3 70B 및 DeepSeek-R1을 포함합니다. 연구진은 단일 반응을 기준으로 판단하는 대신 대화를 계속하면서 모델에 거짓이라고 생각되는 정보를 반복적으로 제공했습니다.
이 연구에서는 명백한 넌센스부터 매우 모호한 정보까지 다양한 100개의 거짓 진술을 사용했습니다. 그런 다음 연구원들은 챗봇이 결국 포기하고 동의하는지 확인하기 위해 단일 대화 중에 잘못된 정보를 최대 50번까지 반복했습니다.

거짓말을 계속 반복하면 결국 AI가 동의할 수도 있습니다.
7개 모델 중 어느 것도 완전히 안전한 것은 없었습니다. ChatGPT 3.5는 중복 허위 정보에 가장 취약한 것으로 입증되었으며, 통신의 12.3%에서 허위 진술을 확인했습니다. Claude 3.5 Sonnet은 0.08%에 불과한 반면, GPT-4o와 GPT-4o-mini는 1% 미만을 유지했습니다.
ChatGPT 3.5는 처음에 100개의 허위 주장 중 96개를 거부했습니다. 이후 같은 주장이 50번이나 반복됐지만 18번이나 동의했다. 연구자들은 또한 일부 모델이 동일한 잘못된 정보에 대해 동의와 동의하지 않는 사이를 번갈아 가며 나타나는 현상을 관찰했는데, 이러한 행동을 ‘반향’이라고 불렀습니다.
AI는 또한 주제가 모호하고 온라인에서 상대적으로 정보가 거의 없는 경우 더 취약했습니다. 연구자들은 반복된 테스트에서 정보의 모호성과 잘못된 정보의 수용 사이에 통계적으로 유의미한 관계가 있음을 발견했습니다.

AI와의 논쟁은 놀라운 결과를 낳았습니다.
연구원들은 또한 논란의 여지가 있는 답변으로 챗봇을 추진하려고 시도했습니다. 대부분의 모델은 실제로 매우 잘 유지되었지만 DeepSeek-R1은 주요 예외였습니다. 단순 반복 시 오확인 비율은 1%에서 논란 스트레스로 인해 22.2%로 증가했다. 빈정거림과 유머의 빈번한 사용으로 인해 일부 반응은 연구자들이 신뢰성 있게 분류하기 어렵게 만들었습니다.
모델들에게 자신의 실수를 바로잡을 수 있는 새로운 기회가 주어졌다는 것은 좋은 소식이었습니다. GPT-4o, GPT-4o-mini, Gemini 1.5 Pro 및 DeepSeek는 모두 이전 오류를 수정한 반면 GPT-3.5는 32%만 수정했습니다. Claude 3.5 Sonnet은 첫 번째 라운드에서 거의 실수를 범하지 않았지만 그가 저지른 네 가지 실수를 수정하지 못했습니다. 그러나 연구자들은 표본이 너무 작아서 강력한 결론을 내릴 수 없다고 경고했습니다.