해당 보고서는 2025년 07월에 작성되었음을 알립니다.
최근 3년간 ChatGPT를 시작으로 여러 LLM 모델들이 등장하며 빠르게 발전하고 있다. 각 모델별로 장단점이 있고 특정 분야에서 더 뛰어난 성능을 보인다는 평가가 다수 존재한다. https://www.downelink.com/claude-3-vs-gpt-4-vs-gemini-the-ultimate-ai-showdown-in-2024/, https://m.blog.naver.com/sys725/223537543610… 등
그러나 각 자료마다 모델에 대한 평가가 다르다. 또한, 대부분 정밀한 실험을 통해 정확도, 메모리 등 전문적인 부분을 비교하거나 실험에 대한 내용은 없이 결론만 가져다 놓은 경우가 많기 때문에 일반 사용자 입장에서 주관적으로 어떤 모델이 어떤 작업에 적합한지 바로 판단하기 어렵다. 그래서 필자는 직접 openAI, Claude, Gemini, Copilot, Grok을 대상으로 간단한 실험을 통해 직관적으로 사용자가 LLM 모델들의 분야별 성능을 비교할 수 있도록 정리하고자 한다.
수학
코딩
글쓰기
그림 생성
일상 대화
수학 Gemini 2.5 flash > Grok3 > Claude Sonnet 4 > Copilot > GPT-4o
| 모델 | 사칙연산 정확성 | 사칙연산 설명 친절함 | 사칙연산 풀이과정 | 확률통계 문제 이해력 | 확률통계 풀이 논리성 | 확률통계 설명력 | 확률통계 정답 정확성 |
|---|---|---|---|---|---|---|---|
| GPT-4o | 계산 결과가 정확하며, 실수 없이 답을 도출함. | 이모지도 넣고 친절한 설명인듯 하지만 처음 답변은 유치원생이 이해하기에는 어려울 수 있음. 다시 요청했을 때 더 자세하고 친절한 설명을 제공 | 자세한 설명을 두번째 요청했을 때에는 단계별로 풀이 과정을 나누어 제시 | 문제의 조건과 상황을 명확히 파악하고, 필요한 수식과 개념, 용어정리까지 제공. | 단계별로 논리적으로 제시함. | 수식과 함께 쉬운 말로 풀이를 보충 설명, 전반적으로 비전공자도 이해할 수 있게 함. 단, 베이즈 정리를 모르는 사람의 경우 이해가 어려울 수 있음. | 계산 과정과 최종 해석 정확하게 제시. 단, 답이 0.8907이 나와야하는데 8903으로 소수 넷쨰 자리의 계산 정확도 떨어짐. |
| Copilot | 정확함. | 손가락을 활용하여 유치원생이 이해하기 쉽도록 친절히 설명하고 있음. | 풀이 과정이 잘 나와있지만 단계별 풀이는 확인 불가. | 문제의 조건과 상황 명확히 파악. 필요한 수식, 개념, 용어 정리 부족. | 풀이가 간단하게 처리되어 논리적 연결고리가 약함. | 수식을 한글과 같이 표현한 것은 좋지만 전반적으로 설명이 부족함. | GPT와 동일 |
| Gemini 2.5 flash | 후에 풀이에서는 정답이 정확하나, 제시해준 연습문제에서 정답이 틀리는 경우가 존재. | 친절하게 설명하려 노력하지만, 유치원생이 이해하기엔 여전히 어려운 설명. | 풀이 과정이 단계별로 나뉘어 있지만 쉬운 설명은 아님. | 문제의 조건, 상황을 명확히 제시해주지 않았지만 관련 개념은 자세히 설명해줌. | 용어 정의부터 단계별로 아주 자세히 나와있음. | 설명이 자세해 비전공자도 이해하기 용이할 수 있음. | 정답이 정확함. |
| grok3 | 정확함. | 사칙연산이 무엇인지 부터 유치원생의 관점에서 설명해줌. | 풀이 과정이 단계별로 아주 상세함. | 문제 조건, 상황 명확히 제시. 관련 개념과 문제를 엮어서 자세히 설명. | Gemini와 마찬가지로 단계별로 상세히 설명됨. | 포아송 분포에 대한 설명은 좋지만 베이즈정리는 설명이 부족함. | 0.8906으로 GPT, Copilot보다는 정확하지만 정확도 살짝 떨어짐. |
| claude sonnet 4 | 정확함. | 어린이도 이해할 수 있도록 풍부한 예시와 비유 사용, 또한 대화형 아티팩트를 제공하여 실제 프린트해서 자료로 사용해도 될 정도로 퀄리티가 좋음. | 단계별로 상세하진 않음. | 문제의 조건과 상황을 꼼꼼하게 해석 | 단계별로 풀이가 나오지만 다소 간단한 경향이 있음. | 포아송 분포에 대한 설명이 존재하지만 이해하기 쉬운 자세한 설명은 없음. | 0.8904로 정확도 떨어짐. |
코딩 Claude Sonnet 4 > Gemini 2.5 flash > Copilot > GPT-4o > Grok3
| 모델 | 자기소개 웹사이트 필수 정보 | 자기소개 창의성/확장성 | 자기소개 코드 품질 | 자기소개 실행 용이성 | 미로 정확성 | 미로 코드 품질 | 미로 테스트 다양성 | 미로 실행/시각화 | 미로 설명력 |
|---|---|---|---|---|---|---|---|---|---|
| GPT-4o | O | 반응형 레이아웃, 다크모드 토글 추가. 그러나 다크모드 작동 안되고 GitHub에 다른 사람의 저장소를 링크 걸어놓음. | 비교적 간단하게 html만 사용하여 코드 작성됨. 어떤 부분이 무슨 코드인지 간단히 주석이 작성됨. | 코드 실행 방법이 두 단계로 나와있고 실제로 실행이 용이함. 다만, 2번에 브라우저에서 더블클릭을 한다는 말이 헷갈릴수도 있음 | 정확 | 주석이 거의 작성돼있지 않음. 함수 네이밍이 일관적이지 않음. (bfs, print_maze 혼합) | 탈출 불가한 미로도 넣어서 다양한 테스트 케이스를 제공. 단, 케이스 1,2번의 경우 거의 유사. | 미로 탈출의 시각화는 잘 되어있음. 단, S, *, E 등 기호에 대한 설명이 없음. 또한, 실행 방법이 불친절함. 파이썬을 사용해본 적이 없거나 cmd를 사용할줄 모르면 실행 불가한 수준. | 사용 알고리즘에 대한 설명이 부족함. BFS 알고리즘을 모르는 사람이라면 이해하기 어려움. |
| Copilot | 이름 X | 반응형 레이아웃, 다크모드 토글 추가. 다크모드 제대로 작동함. | 실행 방법 안내가 잘되어있고 실행도 잘됨. | 정확 | 주석이 아예 없음. 함수 네이밍이 GPT와 동일. | 테스트 케이스가 단순하거나 반복적임. | 그림과 이모지를 이용하여 시각화가 훨씬 잘되어있음. 또한, 미로의 형태와 출발점, 도착점 모두 제시해줌. 파이썬 설치부터 안내해줌. (단, cmd를 사용할줄 모르면 실행 어려움 있음) | 마찬가지로 BFS 알고리즘을 모르는 사람은 이해하기 어려운 설명이지만 GPT보다는 자세함. | |
| Gemini 2.5 flash | O | 반응형 레이아웃, 모던한 UI를 제공함. 디자인적으로 많이 신경썼으나 다른 기능은 없음. | CSS, JavaScript 이용하여 난이도가 꽤 있음. 주석이 존재하긴 하나 CSS와 javascript코드가 어디인지만 확인할 수 있는 정도로 다소 부족함. | 실행 방법 안내가 잘 되어있고 실행도 잘됨. | 정확 | bfs함수 따로 제공 안함, 주석이 자세한 편임. 함수 네이밍도 일관성을 보임. | 5가지 테스트 케이스가 다양하게 잘 제공됨. | 시각화 잘 되어있음. GPT와 마찬가지로 실행 방법이 불친절함. 일반 사용자는 실행할 수 없을 수 있음. | 알고리즘 설명이 자세함. |
| grok3 | O | 반응형 레이아웃, 다크모드 기능 추가. 다크모드 작동 안함. | React 사용. 다른 모델들에 비해 난이도 높은편. 주석이 없음. | 실행 방법 안내가 잘 되어있고 실행도 잘 됨. | 미로 알고리즘 구현이 불완전하거나 오류가 있음 | 가독성이 낮고 html로 작성되어있음. 실행이 애초에 안됨. | 여러가지 미로를 구현하고자 했지만 시작점,도착점이 같은 케이스 등에 대해서는 제공 안됨. | 실행 안됨. | 알고리즘 설명이 다소 부족. |
| claude sonnet 4 | O | 반응형 디자인, 다크모드, 타이핑 효과, 알림 메시지 등을 제공하고 무엇보다 디자인과 애니메이션이 매우 뛰어남. | 코드가 체계적이고, 구조가 뛰어남. 주석이 존재하지만 부족. | 실행 방법을 단계별로 상세히 안내하였고 두가지 방법을 제시함. 실행도 잘되고 미리보기도 볼 수 있음. | 정확 | 코드 품질이 매우 우수함. 주석도 나쁘지 않은편. | 5가지 테스트 케이스를 상황별로 다양하게 제시 | 결과를 시각적으로 보여주는 코드도 제안. 테스트 케이스도 제공하고 UI적으로 매우 훌륭함. | 알고리즘에 대한 기본 정보를 제공해주지만 BFS를 모르는 사람들은 이해하기 어려울 수 있음. |
글쓰기 Claude Sonnet 4> GPT-4o > Gemini 2.5 flash > Grok3 > Copilot
| 모델 | 블로그 요약 핵심 파악력 | 블로그 요약력 | 블로그 정확성 | 주장문 입장 명확성 | 주장문 논리성 | 주장문 설득력 | 창작글 창의성 | 창작글 문장력/표현력 |
|---|---|---|---|---|---|---|---|---|
| GPT-4o | 글의 핵심 내용을 빠짐없이 정확하게 파악 | 불필요한 내용 없이 간결하게 요약. 마지막에 요약정리도 해주어 한눈에 보기 좋음. | 원문 내용에 충실하며, 허위 정보 없음 | 긍정적 입장을 선택했고, 근거를 체계적으로 제시 | 주장-근거-예시 구조가 논리적으로 전개. | 구체적 근거와 예시로 설득력 높음 | O | 문장 구조가 자연스럽고, ‘그렇다, 괜찮다’ 로 리듬감도 있음. |
| Copilot | 전혀 다른 내용을 다루고 있음. | 요약을 떠나서 아예 다른 내용임. | 원문 내용과 불일치. | 긍정적 입장을 선택. | 구조가 논리적으로 전개되고 있으나, 부자연스러움. | 설득력이 다소 부족 | O | 시가 짧고 한줄로 작성되어 시의 리듬감 등이 많이 부족함. |
| Gemini 2.5 flash | 핵심 내용 파악은 잘하나, 요약이 다소 기계적 | 불필요한 내용 없이 잘 요약됨. 다만, 가독성이 조금 떨어짐. | 원문 내용에 충실, 허위정보X | 입장을 명확히 밝히고, 근거를 간단히 제시 | 주장 이후 근거가 논리적으로 전개되고 있으나, 주장문이라기보단 보고서에 가까움 | GPT와 비슷. | O | 문장 구조가 자연스럽고 시의 형태를 잘 갖춤. 문장력도 좋은 편. |
| grok3 | 핵심 내용 중 일부가 누락됨 | 요약이 짧고, 중요한 내용이 빠져있음. | 원문 내용에 없는 정보가 있음. | 입장을 명확히 하였고 근거도 잘 제시함. | 논리적 구조가 잘되어있지만 보고서 형식. | GPT와 비슷. | O | 문장 구조가 단순, 어휘가 제한적 |
| claude sonnet 4 | 글의 핵심을 정확하게 파악하고, 중요한 포인트를 놓치지 않음 | 불필요한 내용 없이 핵심만 간결하게 요약 | 원문 내용에 충실, 허위 정보 없음 | 입장을 분명하게 밝히고, 근거와 예시를 풍부하게 제시 | 논리적 구조가 체계적이고, 전개가 제일 자연스러움 | GPT와 비슷 | 참신한 아이디어와 독창적 표현이 돋보임 | 문장 구조가 유려하고, 어휘가 다양함 |
그림 생성 Grok3 > Gemini 2.5 flash > Copilot > GPT-4o > Claude Sonnet 4
| 모델 | 그림 발전 창의성 | 그림 발전성 | 그림 발전 설명력 | 그림 생성 창의성 | 그림 생성 설명력 |
|---|---|---|---|---|---|
| GPT-4o | 원본 그림의 특징을 정확히 살리면서 구름이나 하늘 등을 추가하고 배경색을 칠해 조화롭게 발전시킴. | 기존 그림에서 발전된 점이 명확히 드러남 | 변화된 부분을 명확히 파악하고 있으며 창작 의도를 구체적으로 설명 | 프롬프트의 주제를 바탕으로 이미지를 생성. 그림보다는 사진에 가깝고 독창성은 높지 않음. | 그림의 특징과 창작 의도를 구체적으로 설명 |
| Copilot | 원본 그림의 구성요소들을 유지하되 색감 등이 아예 바꼈고 새로운 느낌으로 발전시킴. | 기존 그림에서 아예 다른 그림체로 발전. | 변화된 부분 설명이 부족하고 현대적인 느낌을 준다고 했지만 그림을 보면 그렇진 않음. | 프롬프트에 맞는 이미지를 생성하나, 창의성이 부족. 마찬가지로 사진에 가까움. | 그림에 존재하지 않는 고양이에 대해 설명함. 설명 내용과 그림이 불일치. |
| Gemini 2.5 flash | 원본 그림에서 변화가 제일 많이 이루어짐. | 기존 그림에서 높은 퀄리티의 그림으로 발전. | 변화된 부분이 명확히 설명되어있고 그림과 일치함. | 프롬프트에 맞는 이미지라고 볼 수 있긴 하나 다른 모델들에 비해 이해도 떨어짐. 창의성이 부족. | 그림의 특징과 창작의도 잘 설명됨. |
| grok3 | 원본 그림에 오리, 배경 등을 추가하여 생동감있게 변화. | 생동감있게 그림이 발전되었으나, 부자연스러운 부분이 존재. | 추가한 부분을 잘 설명했지만 기존의 것에서 어떻게 바꿨는지에 대해 디테일한 설명 다소 부족. | 프롬프트에 맞고 여러 요소를 추가함. 비슷한 구도의 그림들이 당연히 존재하지만 다른 모델들에 비해 창의성이 좋은 편. | 그림의 특징과 창작 의도 잘 설명됨. |
| claude sonnet 4 | 이미지 생성 기능은 없으나, 기존 그림을 이용해 아예 다르게 변화. | 기존 그림과는 차이가 꽤 큼. 이미지 생성 기능이 없다보니 부자연스러운 부분도 존재. | 변화된 부분과 창작 의도를 자세히 설명. | 프롬프트에 맞게하고 별똥별 등 추가. 비슷한 구도의 그림들이 당연히 존재해서 창의성은 다소 부족. | 그림의 구성요소와 창작 의도, 특징을 자세히 설명. |
일상대화 Claude Sonnet 4 > Copilot > GPT-4o >Gemini 2.5 flash > Grok3
| 모델 | 자연스러움 | 공감력 | 문장스타일 | 조언의 적절성 |
|---|---|---|---|---|
| GPT-4o | 상황에 맞는 대답을 하지만 자연스러움과는 거리가 조금 있음. 비서 느낌. | 사용자의 감정에 공감하며, 따뜻한 반응을 보임 | 부드럽고 친근한 말투, 이모티콘 사용 | 보고서 같은 체계적인 조언을 제시 |
| Copilot | 친구와의 대화 예시가 꽤 자연스럽고 맥락 파악도 잘하는 편. | 마찬가지로 공감은 잘하는 편 | 하나의 답변에 존댓말과 반말이 어색하게 섞여 있는 경우가 있음. 이모티콘, 부드러운 말투 사용 | 적절한 조언 제시 |
| Gemini 2.5 flash | 날씨 정보를 제공하여 비서같은 느낌없이 가장 자연스러운 대답을 함. 친구와의 대화는 좀 부자연스러움 | 공감 표현이 있으나, 감정이입이 깊지는 않음 | 경어체를 사용. 다소 딱딱하게 느껴질 수 있음. | 현실적이지만 다소 평이하고 보고서 같은 조언 |
| grok3 | 상황, 맥락 잘 파악함. 친구와의 대화 자연스러움 | 공감 표현이 부족하거나, 기계적 | 단조로운 문장. 경어체 사용. | 조언이 간단하거나, 구체성이 부족 |
| claude sonnet 4 | 친구와의 대화 자연스러움. 날씨질문의 경우 비서 같은 느낌. | 사용자의 감정에 깊이 공감. | 부드럽고 세련된 문장, 경어체 사용. | 현실적이면서도 배려심 있는 조언을 자연스럽고 부드럽게 제시 |
Claude는 코딩과 시각화에 매우 뛰어나다. 또한, 문장력이 좋다.
Gemini는 단순한 계산 문제에서 실수가 있기도 했지만 결론적으로 어려운 문제에 대해 높은 정확도를 보였고 자세한 설명, 풀이도 제공해준다.
Grok은 전반적으로 중상 정도의 성능을 가진다.
GPT는 요약과 빠른 속도가 장점이다. 첫시도에 좋은 결과물을 주기보다는 여러번 반복했을 때 발전하는 경향을 보인다.
Copilot은 빠르게 최적의 결과를 제공하는 듯하지만 실수가 꽤 있는 편이다.
Claude는 코드를 작성하고 미리보기를 제공해주는 것이 좋지만 속도는 꽤나 느린 편이다.
전체적인 평가 기준을 통합해서 순위를 매겼을 때 수학에서는 Gemini, 글쓰기, 코딩, 일상대화에서는 Claude, 그림 생성은 Grok이 1위를 차지했다. 그러나 간단한 실험이기도 하고 정량적인 평가보다는 주관적인 평가가 많이 들어가서 앞의 결과대로 꼭 그 분야에서 특정 모델이 매우 뛰어나다 라고 결론 짓기는 어려울 것 같다.
Claude와 Grok은 아예 처음 사용해봤는데 생각보다 Grok도 높은 수준의 성능을 보여줬고 Claude의 시각화 능력에는 정말 놀랐다. 그래서 이번 기회에 새로운 모델들도 사용해보며 느낀 것은 귀찮더라도 새로운 모델이 나오거나 업데이트 되었을 때 다 사용해봐야 한다는 것이다. 한 가지 모델만 사용한다면 맹신하게 되는 일도 있고 판단력도 사용할 일이 더 적다. 다양한 모델들을 사용하면 적어도 그 모델들을 비교하면서 판단능력을 기를 수 있게 되고 또한 처음에는 시간이 많이 들고 귀찮을 수 있겠지만 각 모델에 대한 특징도 파악할 수 있다. 그래서 이왕 LLM 모델을 사용할 것이라면 최대한 많이 다양한 모델들을 접해보고 그에 대해 생각해보는 시간을 갖는 것이 중요하다는 것을 깨달았다.
실험을 설계하면서 어떤 부분에서 차이가 나고 어떤 결과가 나오겠다 예상을 한 것들이 맞은 경우도 있었지만 아예 예상을 빗나간 결과를 보인 실험들도 존재했다. 이를 통해 너무 좁은 시각으로 모델들을 바라본 것에 대해 반성할 수 있었고 앞서 시사점에서도 이야기했지만 다양한 모델들을 활용하는 것이 앞으로 더욱 중요해질 것이라 생각한다. 또한, 이번 기회에 새로운 모델들도 접하고 간단한 실험들이었지만 여러 분야에 대해 각 모델들의 성능을 잘 느낄 수 있었던 것 같다.
주어진 시간에 한계가 있어서 보다 정교한 실험을 진행하지 못한 부분이 아쉬웠고 추후에 더 보완하여 더 많은 데이터와 실험을 하고 평가기준도 정량적인 기준도 설계하여 각 모델별로 자세한 성능을 평가할 수 있으면 좋을 것 같다.