대표 LLM 모델들의 분야별 성능 비교 분석 및 정리: 멀티 모델 활용의 필요성을 포함하여

수정·2026년 3월 21일

해당 보고서는 2025년 07월에 작성되었음을 알립니다.

개요

최근 3년간 ChatGPT를 시작으로 여러 LLM 모델들이 등장하며 빠르게 발전하고 있다. 각 모델별로 장단점이 있고 특정 분야에서 더 뛰어난 성능을 보인다는 평가가 다수 존재한다. https://www.downelink.com/claude-3-vs-gpt-4-vs-gemini-the-ultimate-ai-showdown-in-2024/, https://m.blog.naver.com/sys725/223537543610…

그러나 각 자료마다 모델에 대한 평가가 다르다. 또한, 대부분 정밀한 실험을 통해 정확도, 메모리 등 전문적인 부분을 비교하거나 실험에 대한 내용은 없이 결론만 가져다 놓은 경우가 많기 때문에 일반 사용자 입장에서 주관적으로 어떤 모델이 어떤 작업에 적합한지 바로 판단하기 어렵다. 그래서 필자는 직접 openAI, Claude, Gemini, Copilot, Grok을 대상으로 간단한 실험을 통해 직관적으로 사용자가 LLM 모델들의 분야별 성능을 비교할 수 있도록 정리하고자 한다.

실험 방법

  • 실험 모델: GPT-4o, Copilot, Gemini 2.5 Flash, Grok3, Claude Sonnet 4
  • 실험 분야
    • 수학 : 초등학교 수준의 아주 쉬운 문제와 어려운 문제 두 종류를 주고, 정답의 정확성, 풀이 과정의 논리성과 자세함, 설명의 친절함 등을 평가한다
    • 코딩 : 간단한 웹사이트를 구현과 미로 탈출 문제를 요청하여 코드의 정확성 및 실행 가능 여부, 코드 스타일(주석, 가독성, 구성 등), 웹사이트의 UI 및 기능 완성도, 미로 탈출 알고리즘의 적절성 및 효율성 (일반인 관점: 미로 탈출 결과의 직관성, 전공자: 사용 알고리즘 분석)을 평가한다.
    • 글쓰기 : 글 요약, 논리적 글 작성, 창작(ex. 시, 짧은 대사 등) 3가지 종류의 글을 요청하여 요약의 정확성 및 가독성, 논리성, 창의성 등을 평가한다.
    • 그림 생성 : 그림판에 간단한 그림을 그려 발전시키는 유형과 프롬프트 기반으로 이미지 생성 두 가지 실험을 통해 프롬프트 반영의 정확성, 이미지의 창의성 및 완성도 등을 평가한다.
    • 일상대화 : 일상대화, 고민 상담 등을 통해 공감력, 문장 스타일, 대화의 일관성 등을 평가한다.

실험 문제

  • 수학

    사칙연산

    🗣 사칙연산에 대한 문제와 답 제공해줘.
    • 추가질문: 문제에 대한 개념과 풀이를 유치원생도 이해할 수 있게 자세히 설명해줘.
    • 평가항목
      • 정확성: 문제, 개념, 답이 정확한가
      • 설명의 친절함: 얼마나 알기 쉽게 설명했는가
      • 풀이 과정: 단계별 설명이 논리적이고 누락 없이 제시됐는가

    확률통계(대학과정)

    🗣 The number of times that an individual contracts a cold in a given year is a Poisson random variable with parameter λ = 3. Suppose a new wonder drug (based on large quantities of vitamin C) has just been marketed that reduces the Poisson parameter to λ = 2 for 75 percent of the population. For the other 25 percent of the population, the drug has no appreciable effect on colds. If an individual tries the drug for a year and has 0 colds in that time, how likely is it that the drug is beneficial for him or her? 이 문제에 대한 설명을 해주고 확률통계(대학과정)을 배우지 않은 일반인도 이해할 수 있게 상세한 풀이과정과 답을 제시해줘. - 추가질문: - 평가항목 - **문제 이해력**: 문제 상황.조건을 정확히 해석했는가 - **풀이 과정의 논리성**: 단계별로 명확하고 논리적으로 전개했는가 - **설명력**: 얼마나 쉽고 자세히 설명했는가 - **정답의 정확성**: 계산 결과와 해석이 정확한가
  • 코딩

    자기소개 웹사이트 구현

    🗣 이름, 간단한 자기소개, 연락처, 프로필 사진을 포함하고 이 외에도 너가 필요하다고 생각하는 기능이나 디자인 요소, 웹 반응성 등 자유롭게 추가해서 간단하지만 너의 코딩 실력을 보여줄 수 있는 자기소개 웹사이트 구현해줘. 전체 코드 한번에 보여주고 누구나 쉽게 바로 실행해볼 수 있도록 실행 방법도 안내해줘.
    • 평가항목
      - 필수 정보 포함 여부: 이름, 간단한 자기소개, 연락처, 프로필 사진
      - 창의성/확장성: 추가 기능.디자인.반응성 등 구현 여부
      - 코드 품질: 가독성, 구조, 주석
      - 실행 용이성: 실행 방법 안내가 명확한지, 실제로 쉽게 실행 가능한지

    미로 탈출 문제

    🗣 아래 조건을 만족하는 미로 탈출 프로그램을 구현해줘.
    - 미로는 0과 1로 이루어진 배열로 주어진다. (0은 벽이고 1은 이동 가능한 칸)
    - 시작점과 도착점은 매번 새로 설정
    - 상하좌우로만 이동 가능
    - 5가지 테스트 케이스를 작성
    - 누구나 쉽게 실행해볼 수 있도록 실행 방법도 안내 필수 (결과를 시각적으로 확인할 수 있어야 함)
    - 사용 알고리즘 설명 포함
    - 전체 코드 제공
    • 평가항목
      • 정확성: 올바른 알고리즘 사용했는지, 정답 맞는지
      • 코드 품질: 가독성, 구조, 주석
      • 5가지 테스트 케이스
      • 실행 용이성/시각화: 결과를 시각적으로 확인할 수 있는지, 실행 안내가 충분한지
      • 설명력: 사용 알고리즘을 제대로 설명하고 있는지
  • 글쓰기

    블로그 글 요약

    🗣 https://devocean.sk.com/blog/techBoardDetail.do?ID=166716&boardType=techBlog 이 글의 핵심내용 요약해줘.
    • 평가항목
      • 핵심 파악력: 글의 핵심 내용을 정확히 요약했는가
      • 요약력: 불필요한 내용 없이 잘 요약했는가
      • 정확성: 없는 내용을 지어내진 않았는가

    주장문 작성

    🗣 ‘AI 시대가 가져올 변화’에 대해 긍정적 또는 부정적 중 한 가지 입장을 선택해서 주장문을 작성해줘. 반드시 한쪽 입장을 정하고, 주장에 대한 근거도 포함해야 해.
    • 평가항목
      • 입장 명확성: 한 가지 입장을 명확히 선택했는가
      • 논리성: 주장-근거 구조가 논리적으로 전개됐는가
      • 설득력: 근거와 예시가 타당한가

    창작글

    🗣 간단한 시나 명언 자유 주제로 창작해서 작성해줘. 단, 절대 이미 존재하는 시나 명언을 가져오면 안돼.
    • 평가항목
      • 창의성: 기존에 없는 새로운 시/명언을 창작했는가
      • 문장력/표현력: 문장과 어휘의 창의성
  • 그림 생성

    간단한 그림 발전 요청

    🗣 첨부한 그림을 자유롭게 발전시켜줘. 그리고 발전시킨 그림이 어떻게 달라졌는지, 어떤 의도로 변형했는지도 함께 설명해줘.
    • 평가항목
      • 창의성: 기존 그림을 어떻게 새롭게 발전시켰는가
      • 발전성: 원본 그림에서 발전시킨게 맞는지, 아예 새로 그린 그림이 아닌지
      • 설명력: 발전된 그림의 변화와 창작 의도를 명확히 설명했는가

    그림/이미지 생성

    🗣 별이 가득한 밤하늘을 주제로, 네가 직접 상상해서 자유롭게 그림을 그려줘. 반드시 네가 새롭게 상상한 이미지여야만 해. 그리고 그림의 특징과 창작 의도도 설명해줘.
    • 평가항목
      • 창의성: ‘별 헤는 밤’ 등 유명 작품을 모방하지 않고 새롭게 창작했는가
      • 설명력: 그림의 특징과 창작 의도를 잘 설명했는가
  • 일상 대화

    일상 대화 및 고민상담

    🗣 1. 오늘은 정말 산책 가고 싶은 날씨야. 너가 보기엔 오늘 날씨 어떤 것 같아?
    2. 오랜만에 친구를 만났는데, 서로의 근황을 자연스럽게 나누는 대화를 해줘.
    3. 오늘 회사에서 실수도 하고 친구랑 싸워서 기분이 좋지 않아. 나 어떻게 하면 좋을까?
    • 평가항목
      • 자연스러움: 문맥을 잘 파악하였는가
      • 공감력: 사용자의 이야기, 감정에 진심으로 공감하는가
      • 문장 스타일: 어떤 말투인지, 이모티콘을 사용하는지 등
      • 조언의 적절성: 현실적이고 도움이 되는 조언을 제시하는가

실험 결과

  1. 수학 Gemini 2.5 flash > Grok3 > Claude Sonnet 4 > Copilot > GPT-4o

    모델사칙연산 정확성사칙연산 설명 친절함사칙연산 풀이과정확률통계 문제 이해력확률통계 풀이 논리성확률통계 설명력확률통계 정답 정확성
    GPT-4o계산 결과가 정확하며, 실수 없이 답을 도출함.이모지도 넣고 친절한 설명인듯 하지만 처음 답변은 유치원생이 이해하기에는 어려울 수 있음. 다시 요청했을 때 더 자세하고 친절한 설명을 제공자세한 설명을 두번째 요청했을 때에는 단계별로 풀이 과정을 나누어 제시문제의 조건과 상황을 명확히 파악하고, 필요한 수식과 개념, 용어정리까지 제공.단계별로 논리적으로 제시함.수식과 함께 쉬운 말로 풀이를 보충 설명, 전반적으로 비전공자도 이해할 수 있게 함. 단, 베이즈 정리를 모르는 사람의 경우 이해가 어려울 수 있음.계산 과정과 최종 해석 정확하게 제시. 단, 답이 0.8907이 나와야하는데 8903으로 소수 넷쨰 자리의 계산 정확도 떨어짐.
    Copilot정확함.손가락을 활용하여 유치원생이 이해하기 쉽도록 친절히 설명하고 있음.풀이 과정이 잘 나와있지만 단계별 풀이는 확인 불가.문제의 조건과 상황 명확히 파악. 필요한 수식, 개념, 용어 정리 부족.풀이가 간단하게 처리되어 논리적 연결고리가 약함.수식을 한글과 같이 표현한 것은 좋지만 전반적으로 설명이 부족함.GPT와 동일
    Gemini 2.5 flash후에 풀이에서는 정답이 정확하나, 제시해준 연습문제에서 정답이 틀리는 경우가 존재.친절하게 설명하려 노력하지만, 유치원생이 이해하기엔 여전히 어려운 설명.풀이 과정이 단계별로 나뉘어 있지만 쉬운 설명은 아님.문제의 조건, 상황을 명확히 제시해주지 않았지만 관련 개념은 자세히 설명해줌.용어 정의부터 단계별로 아주 자세히 나와있음.설명이 자세해 비전공자도 이해하기 용이할 수 있음.정답이 정확함.
    grok3정확함.사칙연산이 무엇인지 부터 유치원생의 관점에서 설명해줌.풀이 과정이 단계별로 아주 상세함.문제 조건, 상황 명확히 제시. 관련 개념과 문제를 엮어서 자세히 설명.Gemini와 마찬가지로 단계별로 상세히 설명됨.포아송 분포에 대한 설명은 좋지만 베이즈정리는 설명이 부족함.0.8906으로 GPT, Copilot보다는 정확하지만 정확도 살짝 떨어짐.
    claude sonnet 4정확함.어린이도 이해할 수 있도록 풍부한 예시와 비유 사용, 또한 대화형 아티팩트를 제공하여 실제 프린트해서 자료로 사용해도 될 정도로 퀄리티가 좋음.단계별로 상세하진 않음.문제의 조건과 상황을 꼼꼼하게 해석단계별로 풀이가 나오지만 다소 간단한 경향이 있음.포아송 분포에 대한 설명이 존재하지만 이해하기 쉬운 자세한 설명은 없음.0.8904로 정확도 떨어짐.
  2. 코딩 Claude Sonnet 4 > Gemini 2.5 flash > Copilot > GPT-4o > Grok3

    모델자기소개 웹사이트 필수 정보자기소개 창의성/확장성자기소개 코드 품질자기소개 실행 용이성미로 정확성미로 코드 품질미로 테스트 다양성미로 실행/시각화미로 설명력
    GPT-4oO반응형 레이아웃, 다크모드 토글 추가. 그러나 다크모드 작동 안되고 GitHub에 다른 사람의 저장소를 링크 걸어놓음.비교적 간단하게 html만 사용하여 코드 작성됨. 어떤 부분이 무슨 코드인지 간단히 주석이 작성됨.코드 실행 방법이 두 단계로 나와있고 실제로 실행이 용이함. 다만, 2번에 브라우저에서 더블클릭을 한다는 말이 헷갈릴수도 있음정확주석이 거의 작성돼있지 않음. 함수 네이밍이 일관적이지 않음. (bfs, print_maze 혼합)탈출 불가한 미로도 넣어서 다양한 테스트 케이스를 제공. 단, 케이스 1,2번의 경우 거의 유사.미로 탈출의 시각화는 잘 되어있음. 단, S, *, E 등 기호에 대한 설명이 없음. 또한, 실행 방법이 불친절함. 파이썬을 사용해본 적이 없거나 cmd를 사용할줄 모르면 실행 불가한 수준.사용 알고리즘에 대한 설명이 부족함. BFS 알고리즘을 모르는 사람이라면 이해하기 어려움.
    Copilot이름 X반응형 레이아웃, 다크모드 토글 추가. 다크모드 제대로 작동함. 실행 방법 안내가 잘되어있고 실행도 잘됨.정확주석이 아예 없음. 함수 네이밍이 GPT와 동일.테스트 케이스가 단순하거나 반복적임.그림과 이모지를 이용하여 시각화가 훨씬 잘되어있음. 또한, 미로의 형태와 출발점, 도착점 모두 제시해줌. 파이썬 설치부터 안내해줌. (단, cmd를 사용할줄 모르면 실행 어려움 있음)마찬가지로 BFS 알고리즘을 모르는 사람은 이해하기 어려운 설명이지만 GPT보다는 자세함.
    Gemini 2.5 flashO반응형 레이아웃, 모던한 UI를 제공함. 디자인적으로 많이 신경썼으나 다른 기능은 없음.CSS, JavaScript 이용하여 난이도가 꽤 있음. 주석이 존재하긴 하나 CSS와 javascript코드가 어디인지만 확인할 수 있는 정도로 다소 부족함.실행 방법 안내가 잘 되어있고 실행도 잘됨.정확bfs함수 따로 제공 안함, 주석이 자세한 편임. 함수 네이밍도 일관성을 보임.5가지 테스트 케이스가 다양하게 잘 제공됨.시각화 잘 되어있음. GPT와 마찬가지로 실행 방법이 불친절함. 일반 사용자는 실행할 수 없을 수 있음.알고리즘 설명이 자세함.
    grok3O반응형 레이아웃, 다크모드 기능 추가. 다크모드 작동 안함.React 사용. 다른 모델들에 비해 난이도 높은편. 주석이 없음.실행 방법 안내가 잘 되어있고 실행도 잘 됨.미로 알고리즘 구현이 불완전하거나 오류가 있음가독성이 낮고 html로 작성되어있음. 실행이 애초에 안됨.여러가지 미로를 구현하고자 했지만 시작점,도착점이 같은 케이스 등에 대해서는 제공 안됨.실행 안됨.알고리즘 설명이 다소 부족.
    claude sonnet 4O반응형 디자인, 다크모드, 타이핑 효과, 알림 메시지 등을 제공하고 무엇보다 디자인과 애니메이션이 매우 뛰어남.코드가 체계적이고, 구조가 뛰어남. 주석이 존재하지만 부족.실행 방법을 단계별로 상세히 안내하였고 두가지 방법을 제시함. 실행도 잘되고 미리보기도 볼 수 있음.정확코드 품질이 매우 우수함. 주석도 나쁘지 않은편.5가지 테스트 케이스를 상황별로 다양하게 제시결과를 시각적으로 보여주는 코드도 제안. 테스트 케이스도 제공하고 UI적으로 매우 훌륭함.알고리즘에 대한 기본 정보를 제공해주지만 BFS를 모르는 사람들은 이해하기 어려울 수 있음.
  3. 글쓰기 Claude Sonnet 4> GPT-4o > Gemini 2.5 flash > Grok3 > Copilot

    모델블로그 요약 핵심 파악력블로그 요약력블로그 정확성주장문 입장 명확성주장문 논리성주장문 설득력창작글 창의성창작글 문장력/표현력
    GPT-4o글의 핵심 내용을 빠짐없이 정확하게 파악불필요한 내용 없이 간결하게 요약. 마지막에 요약정리도 해주어 한눈에 보기 좋음.원문 내용에 충실하며, 허위 정보 없음긍정적 입장을 선택했고, 근거를 체계적으로 제시주장-근거-예시 구조가 논리적으로 전개.구체적 근거와 예시로 설득력 높음O문장 구조가 자연스럽고, ‘그렇다, 괜찮다’ 로 리듬감도 있음.
    Copilot전혀 다른 내용을 다루고 있음.요약을 떠나서 아예 다른 내용임.원문 내용과 불일치.긍정적 입장을 선택.구조가 논리적으로 전개되고 있으나, 부자연스러움.설득력이 다소 부족O시가 짧고 한줄로 작성되어 시의 리듬감 등이 많이 부족함.
    Gemini 2.5 flash핵심 내용 파악은 잘하나, 요약이 다소 기계적불필요한 내용 없이 잘 요약됨. 다만, 가독성이 조금 떨어짐.원문 내용에 충실, 허위정보X입장을 명확히 밝히고, 근거를 간단히 제시주장 이후 근거가 논리적으로 전개되고 있으나, 주장문이라기보단 보고서에 가까움GPT와 비슷.O문장 구조가 자연스럽고 시의 형태를 잘 갖춤. 문장력도 좋은 편.
    grok3핵심 내용 중 일부가 누락됨요약이 짧고, 중요한 내용이 빠져있음.원문 내용에 없는 정보가 있음.입장을 명확히 하였고 근거도 잘 제시함.논리적 구조가 잘되어있지만 보고서 형식.GPT와 비슷.O문장 구조가 단순, 어휘가 제한적
    claude sonnet 4글의 핵심을 정확하게 파악하고, 중요한 포인트를 놓치지 않음불필요한 내용 없이 핵심만 간결하게 요약원문 내용에 충실, 허위 정보 없음입장을 분명하게 밝히고, 근거와 예시를 풍부하게 제시논리적 구조가 체계적이고, 전개가 제일 자연스러움GPT와 비슷참신한 아이디어와 독창적 표현이 돋보임문장 구조가 유려하고, 어휘가 다양함
  4. 그림 생성 Grok3 > Gemini 2.5 flash > Copilot > GPT-4o > Claude Sonnet 4

    모델그림 발전 창의성그림 발전성그림 발전 설명력그림 생성 창의성그림 생성 설명력
    GPT-4o원본 그림의 특징을 정확히 살리면서 구름이나 하늘 등을 추가하고 배경색을 칠해 조화롭게 발전시킴.기존 그림에서 발전된 점이 명확히 드러남변화된 부분을 명확히 파악하고 있으며 창작 의도를 구체적으로 설명프롬프트의 주제를 바탕으로 이미지를 생성. 그림보다는 사진에 가깝고 독창성은 높지 않음.그림의 특징과 창작 의도를 구체적으로 설명
    Copilot원본 그림의 구성요소들을 유지하되 색감 등이 아예 바꼈고 새로운 느낌으로 발전시킴.기존 그림에서 아예 다른 그림체로 발전.변화된 부분 설명이 부족하고 현대적인 느낌을 준다고 했지만 그림을 보면 그렇진 않음.프롬프트에 맞는 이미지를 생성하나, 창의성이 부족. 마찬가지로 사진에 가까움.그림에 존재하지 않는 고양이에 대해 설명함. 설명 내용과 그림이 불일치.
    Gemini 2.5 flash원본 그림에서 변화가 제일 많이 이루어짐.기존 그림에서 높은 퀄리티의 그림으로 발전.변화된 부분이 명확히 설명되어있고 그림과 일치함.프롬프트에 맞는 이미지라고 볼 수 있긴 하나 다른 모델들에 비해 이해도 떨어짐. 창의성이 부족.그림의 특징과 창작의도 잘 설명됨.
    grok3원본 그림에 오리, 배경 등을 추가하여 생동감있게 변화.생동감있게 그림이 발전되었으나, 부자연스러운 부분이 존재.추가한 부분을 잘 설명했지만 기존의 것에서 어떻게 바꿨는지에 대해 디테일한 설명 다소 부족.프롬프트에 맞고 여러 요소를 추가함. 비슷한 구도의 그림들이 당연히 존재하지만 다른 모델들에 비해 창의성이 좋은 편.그림의 특징과 창작 의도 잘 설명됨.
    claude sonnet 4이미지 생성 기능은 없으나, 기존 그림을 이용해 아예 다르게 변화.기존 그림과는 차이가 꽤 큼. 이미지 생성 기능이 없다보니 부자연스러운 부분도 존재.변화된 부분과 창작 의도를 자세히 설명.프롬프트에 맞게하고 별똥별 등 추가. 비슷한 구도의 그림들이 당연히 존재해서 창의성은 다소 부족.그림의 구성요소와 창작 의도, 특징을 자세히 설명.
  5. 일상대화 Claude Sonnet 4 > Copilot > GPT-4o >Gemini 2.5 flash > Grok3

    모델자연스러움공감력문장스타일조언의 적절성
    GPT-4o상황에 맞는 대답을 하지만 자연스러움과는 거리가 조금 있음. 비서 느낌.사용자의 감정에 공감하며, 따뜻한 반응을 보임부드럽고 친근한 말투, 이모티콘 사용보고서 같은 체계적인 조언을 제시
    Copilot친구와의 대화 예시가 꽤 자연스럽고 맥락 파악도 잘하는 편.마찬가지로 공감은 잘하는 편하나의 답변에 존댓말과 반말이 어색하게 섞여 있는 경우가 있음. 이모티콘, 부드러운 말투 사용적절한 조언 제시
    Gemini 2.5 flash날씨 정보를 제공하여 비서같은 느낌없이 가장 자연스러운 대답을 함. 친구와의 대화는 좀 부자연스러움공감 표현이 있으나, 감정이입이 깊지는 않음경어체를 사용. 다소 딱딱하게 느껴질 수 있음.현실적이지만 다소 평이하고 보고서 같은 조언
    grok3상황, 맥락 잘 파악함. 친구와의 대화 자연스러움공감 표현이 부족하거나, 기계적단조로운 문장. 경어체 사용.조언이 간단하거나, 구체성이 부족
    claude sonnet 4친구와의 대화 자연스러움. 날씨질문의 경우 비서 같은 느낌.사용자의 감정에 깊이 공감.부드럽고 세련된 문장, 경어체 사용.현실적이면서도 배려심 있는 조언을 자연스럽고 부드럽게 제시

결과 분석

  1. Claude는 코딩과 시각화에 매우 뛰어나다. 또한, 문장력이 좋다.

  2. Gemini는 단순한 계산 문제에서 실수가 있기도 했지만 결론적으로 어려운 문제에 대해 높은 정확도를 보였고 자세한 설명, 풀이도 제공해준다.

  3. Grok은 전반적으로 중상 정도의 성능을 가진다.

  4. GPT는 요약과 빠른 속도가 장점이다. 첫시도에 좋은 결과물을 주기보다는 여러번 반복했을 때 발전하는 경향을 보인다.

  5. Copilot은 빠르게 최적의 결과를 제공하는 듯하지만 실수가 꽤 있는 편이다.

  6. Claude는 코드를 작성하고 미리보기를 제공해주는 것이 좋지만 속도는 꽤나 느린 편이다.

    전체적인 평가 기준을 통합해서 순위를 매겼을 때 수학에서는 Gemini, 글쓰기, 코딩, 일상대화에서는 Claude, 그림 생성은 Grok이 1위를 차지했다. 그러나 간단한 실험이기도 하고 정량적인 평가보다는 주관적인 평가가 많이 들어가서 앞의 결과대로 꼭 그 분야에서 특정 모델이 매우 뛰어나다 라고 결론 짓기는 어려울 것 같다.

시사점

Claude와 Grok은 아예 처음 사용해봤는데 생각보다 Grok도 높은 수준의 성능을 보여줬고 Claude의 시각화 능력에는 정말 놀랐다. 그래서 이번 기회에 새로운 모델들도 사용해보며 느낀 것은 귀찮더라도 새로운 모델이 나오거나 업데이트 되었을 때 다 사용해봐야 한다는 것이다. 한 가지 모델만 사용한다면 맹신하게 되는 일도 있고 판단력도 사용할 일이 더 적다. 다양한 모델들을 사용하면 적어도 그 모델들을 비교하면서 판단능력을 기를 수 있게 되고 또한 처음에는 시간이 많이 들고 귀찮을 수 있겠지만 각 모델에 대한 특징도 파악할 수 있다. 그래서 이왕 LLM 모델을 사용할 것이라면 최대한 많이 다양한 모델들을 접해보고 그에 대해 생각해보는 시간을 갖는 것이 중요하다는 것을 깨달았다.

결론 및 향후 연구 방향성

실험을 설계하면서 어떤 부분에서 차이가 나고 어떤 결과가 나오겠다 예상을 한 것들이 맞은 경우도 있었지만 아예 예상을 빗나간 결과를 보인 실험들도 존재했다. 이를 통해 너무 좁은 시각으로 모델들을 바라본 것에 대해 반성할 수 있었고 앞서 시사점에서도 이야기했지만 다양한 모델들을 활용하는 것이 앞으로 더욱 중요해질 것이라 생각한다. 또한, 이번 기회에 새로운 모델들도 접하고 간단한 실험들이었지만 여러 분야에 대해 각 모델들의 성능을 잘 느낄 수 있었던 것 같다.

주어진 시간에 한계가 있어서 보다 정교한 실험을 진행하지 못한 부분이 아쉬웠고 추후에 더 보완하여 더 많은 데이터와 실험을 하고 평가기준도 정량적인 기준도 설계하여 각 모델별로 자세한 성능을 평가할 수 있으면 좋을 것 같다.

0개의 댓글