
Grok 4.5 vs. GPT-4o: 최신 AI 모델 성능 심층 비교 분석
※ 이 글에는 제휴 마케팅 링크가 포함될 수 있으며, 구매 시 수수료를 받을 수 있습니다. 같은 문제를 풀면서 한 모델은 67,020토큰을 뱉었고, 다른 모델은 15,954토큰으로 끝냈다. 정답률은 오히려 적게 쓴 쪽이 높았다. 이게 Grok 4.5를 둘러싼 소동의 전부다. 벤치마크 1위도 아니고, 컨텍스트가 제일 큰 것도 아니고, 심지어 사실 정확도는 뒷걸음질쳤다. 그런데도 사람들이 이 모델 얘기를 멈추지 않는 이유는 하나다 — 같은 일을 4분의 1의 말수로 해낸다는 것. 그리고 이 글의 다른 주인공, GPT-4o에 대해 먼저 솔직해질 필요가 있다. 이 비교는 공정한 매치가 아니다. ...