
미국 인디애나대학교 연구팀이 챗GPT, 클로드, 제미나이, 그록, 퍼플렉시티 총 5개 주요 AI 챗봇의 실제 대화 14만 2,808건을 분석했다. 그 결과 AI마다 사용자 질문을 해결하는 능력, 정보를 찾아오는 방식, 응답 속도 패턴이 완전히 다른 것으로 나타났다. 이번 연구는 실험실이 아닌 실제 사용 환경에서 AI 챗봇들의 진짜 실력을 비교한 첫 대규모 연구다.
사용자 의도 충족률 1위는 '클로드' 87%… 2위 챗GPT 82%
연구팀이 '대화 완결성'을 분석한 결과, 클로드가 추출된 사용자 의도의 87%를 완벽하게 해결하며 1위를 차지했다. 챗GPT는 82%로 2위를 기록했다. 반면 제미나이는 76%, 그록은 73%에 그쳤다. 퍼플렉시티는 완벽한 답변이 67%에 불과했지만, 부분적인 답변을 25%나 제공해 검색 엔진 특성을 보여줬다.
한 번의 대화에서 다루는 사용자 의도 개수도 AI마다 달랐다. 챗GPT와 클로드는 대화 한 번에 평균 2개의 의도를 처리했지만, 제미나이, 그록, 퍼플렉시티는 평균 1개만 다뤘다. 이는 챗GPT와 클로드가 여러 가지 문제를 동시에 해결하는 데 더 강하다는 뜻이다. 연구팀은 AI 모델 Qwen3-8B를 이용해 각 대화에서 사용자가 원하는 것을 추출한 뒤, '완전히 해결', '부분 해결', '해결 못 함'으로 나눠 평가했다.
다만 이 결과는 개별 의도 수준에서 분석한 것이며, 대화 전체를 봤을 때의 완결성 점수는 챗GPT, 클로드, 그록, 퍼플렉시티 모두 만점에 가까웠고, 제미나이만 다소 낮았다.

관련기사링크 : https://www.etnews.com/20251230000354
미국 인디애나대학교 연구팀이 챗GPT, 클로드, 제미나이, 그록, 퍼플렉시티 총 5개 주요 AI 챗봇의 실제 대화 14만 2,808건을 분석했다. 그 결과 AI마다 사용자 질문을 해결하는 능력, 정보를 찾아오는 방식, 응답 속도 패턴이 완전히 다른 것으로 나타났다. 이번 연구는 실험실이 아닌 실제 사용 환경에서 AI 챗봇들의 진짜 실력을 비교한 첫 대규모 연구다.
사용자 의도 충족률 1위는 '클로드' 87%… 2위 챗GPT 82%
연구팀이 '대화 완결성'을 분석한 결과, 클로드가 추출된 사용자 의도의 87%를 완벽하게 해결하며 1위를 차지했다. 챗GPT는 82%로 2위를 기록했다. 반면 제미나이는 76%, 그록은 73%에 그쳤다. 퍼플렉시티는 완벽한 답변이 67%에 불과했지만, 부분적인 답변을 25%나 제공해 검색 엔진 특성을 보여줬다.
한 번의 대화에서 다루는 사용자 의도 개수도 AI마다 달랐다. 챗GPT와 클로드는 대화 한 번에 평균 2개의 의도를 처리했지만, 제미나이, 그록, 퍼플렉시티는 평균 1개만 다뤘다. 이는 챗GPT와 클로드가 여러 가지 문제를 동시에 해결하는 데 더 강하다는 뜻이다. 연구팀은 AI 모델 Qwen3-8B를 이용해 각 대화에서 사용자가 원하는 것을 추출한 뒤, '완전히 해결', '부분 해결', '해결 못 함'으로 나눠 평가했다.
다만 이 결과는 개별 의도 수준에서 분석한 것이며, 대화 전체를 봤을 때의 완결성 점수는 챗GPT, 클로드, 그록, 퍼플렉시티 모두 만점에 가까웠고, 제미나이만 다소 낮았다.
관련기사링크 : https://www.etnews.com/20251230000354