뉴스




챗GPT vs 클로드 vs 제미나이 vs 퍼플렉시티 vs 그록… 14만 대화 분석했더니 '이 AI'가 1등(2025.12.31)

김종성
2025-12-31
조회수 73

챗GPT vs 클로드 vs 제미나이 vs 퍼플렉시티 vs 그록… 14만 대화 분석했더니 '이 AI'가 1등

미국 인디애나대학교 연구팀이 챗GPT, 클로드, 제미나이, 그록, 퍼플렉시티 총 5개 주요 AI 챗봇의 실제 대화 14만 2,808건을 분석했다. 그 결과 AI마다 사용자 질문을 해결하는 능력, 정보를 찾아오는 방식, 응답 속도 패턴이 완전히 다른 것으로 나타났다. 이번 연구는 실험실이 아닌 실제 사용 환경에서 AI 챗봇들의 진짜 실력을 비교한 첫 대규모 연구다.

사용자 의도 충족률 1위는 '클로드' 87%… 2위 챗GPT 82%

연구팀이 '대화 완결성'을 분석한 결과, 클로드가 추출된 사용자 의도의 87%를 완벽하게 해결하며 1위를 차지했다. 챗GPT는 82%로 2위를 기록했다. 반면 제미나이는 76%, 그록은 73%에 그쳤다. 퍼플렉시티는 완벽한 답변이 67%에 불과했지만, 부분적인 답변을 25%나 제공해 검색 엔진 특성을 보여줬다.

한 번의 대화에서 다루는 사용자 의도 개수도 AI마다 달랐다. 챗GPT와 클로드는 대화 한 번에 평균 2개의 의도를 처리했지만, 제미나이, 그록, 퍼플렉시티는 평균 1개만 다뤘다. 이는 챗GPT와 클로드가 여러 가지 문제를 동시에 해결하는 데 더 강하다는 뜻이다. 연구팀은 AI 모델 Qwen3-8B를 이용해 각 대화에서 사용자가 원하는 것을 추출한 뒤, '완전히 해결', '부분 해결', '해결 못 함'으로 나눠 평가했다.

다만 이 결과는 개별 의도 수준에서 분석한 것이며, 대화 전체를 봤을 때의 완결성 점수는 챗GPT, 클로드, 그록, 퍼플렉시티 모두 만점에 가까웠고, 제미나이만 다소 낮았다.

챗GPT vs 클로드 vs 제미나이 vs 퍼플렉시티 vs 그록… 14만 대화 분석했더니 '이 AI'가 1등


관련기사링크 : https://www.etnews.com/20251230000354