텍스트, 이미지, 오디오와 같은 데이터를 고차원 벡터 형태로 변환해 저장하고, 이 벡터 간의 유사도를 빠르게 검색할 수 있도록 최적화된 데이터베이스
일반적인 관계형 데이터베이스가 정확한 값 기반 검색(SQL 쿼리 등)에 적합하다면,
벡터 데이터베이스는 의미적 유사성(semantic similarity)에 기반한 검색을 지원하여 예를 들어 "강아지"와 "개"처럼 다른 표현이라도 비슷한 의미의 데이터를 찾아낼 수 있다.
이를 위해 코사인 유사도, 내적(dot product), 유클리드 거리와 같은 수학적 거리 계산을 활용하며, 대규모 임베딩(embedding) 데이터를 효율적으로 관리하고 검색할 수 있어 추천 시스템, 검색 엔진, 생성형 AI의 RAG(Retrieval-Augmented Generation) 등에 활용된다.
크로마디비(ChromaDB)
대표적인 오픈소스 벡터 데이터베이스로, 문서·이미지·코드 등 다양한 데이터를 임베딩 벡터로 변환해 저장하고, 이를 빠르게 검색할 수 있도록 설계된 시스템
파이썬 기반으로 사용이 간편하며, LangChain 같은 LLM 프레임워크와 잘 통합되어 RAG(Retrieval-Augmented Generation) 구조를 쉽게 구축할 수 있다.
내부적으로는 벡터 인덱싱과 메타데이터 저장을 함께 지원하여, 단순히 유사도 검색뿐 아니라 조건 필터링과 결합된 검색도 가능하다.
무료로 가볍게 실행할 수 있고, 로컬 환경부터 클라우드까지 유연하게 확장할 수 있어 학습용이나 실무용 AI 검색 엔진 구축에 많이 활용된다.
import getpass
import os
def _set_env(var: str):
if not os.environ.get(var):
os.environ[var] = getpass.getpass(f"{var}: ")
_set_env("OPENAI_API_KEY")
!pip install langchain_community langchain_experimental langchain_openai pypdf
긴 텍스트나 문서를 작은 단위로 나눈 조각
자연어 처리와 RAG(Retrieval-Augmented Generation) 같은 작업에서 사용된다.
대형 언어모델은 한 번에 처리할 수 있는 토큰 수에 한계가 있기 때문에 문서를 일정한 길이로 분할하여 임베딩 벡터로 변환하고, 이후 검색이나 질의 응답 시 필요한 청크만 불러와 모델에 전달하는 방식으로 효율성과 정확성을 높인다.
청크는 단순히 일정 글자 수나 토큰 수로 나누기도 하지만, 문단·문장 단위 등 의미 단위로 나누어야 검색 품질이 좋아지며, 결국 청크는 방대한 데이터를 모델이 다룰 수 있는 크기로 잘게 나눈 최소 단위라고 할 수 있다.
텍스트를 단순히 일정한 길이로 자르는 방식이 아니라, 문장의 의미적 맥락을 고려해 자연스럽게 분할하는 청크 생성 기법
문장이나 문단의 의미가 단절되지 않도록 문맥 단위로 텍스트를 나누어 임베딩과 검색의 정확도를 높여준다.
이를 통해 RAG(Retrieval-Augmented Generation) 구조에서 모델이 보다 관련성 높은 정보를 검색할 수 있으며, 불필요하게 잘려나간 조각이나 중복된 정보 전달을 줄일 수 있다.
SemanticChunker는 의미 기반 검색과 대규모 문서 처리에서 효율성과 정밀도를 동시에 향상시키는 중요한 도구로 활용된다.
from langchain_community.document_loaders import PyPDFLoader
from langchain_experimental.text_splitter import SemanticChunker
from langchain_openai.embeddings import OpenAIEmbeddings
file_path = "SPRi AI Brief_4월호_산업동향_250407_F.pdf"
loader = PyPDFLoader(file_path)
pages = []
# 비동기로 한 번에 전부 읽지 않고 페이지 단위로 스트리밍
async for page in loader.alazy_load():
pages.append(page)
text_splitter = SemanticChunker(OpenAIEmbeddings())
# 페이지별 문서를 여러 개의 의미 청크로 쪼개 반환
docs = text_splitter.split_documents(pages)
print(f"총 {len(docs)}개 만큼의 문서로 청킹되었습니다.")
print([len(i.page_content) for i in docs])
총 33개 만큼의 문서로 청킹되었습니다.
[22, 922, 19, 1562, 1447, 1645, 1682, 19, 1291, 1777, 1801, 1528, 1656, 1755, 78, 1659, 1055, 19, 1545, 1662, 1690, 1628, 91, 1684, 19, 1619, 10, 1447, 1678, 58, 1616, 2460, 225]
# 각 청크의 메타데이터 및 내용 출력
for i in docs:
print(i.metadata) # 문서의 메타데이터 출력 (예: 페이지 번호 등)
print(i.page_content) # 분할된 청크의 내용 출력
print("-" * 100) # 구분선 출력
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 0, 'page_label': '1'}
2025년4월호인공지능 산업의 최신 동향
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 1, 'page_label': '2'}
SPRi AI Brief2025년 4월호
2
CONTENTS정책・법제∙2025년 중국 양회의 정부 업무보고, AI 플러스 행동의 지속 추진을 천명2∙중국 정부, 2025년 9월부터 AI 생성·합성물 표시 의무화 규정 시행 예정 발표3∙인도 전자정보기술부, AI 강국 실현을 위한 AI 로드맵 공개4∙영국 경쟁시장청, 마이크로소프트와 오픈AI 협력 관련 반독점 조사 종료 발표5기업・산업∙구글, 단일 GPU로 구동 가능한 오픈소스 AI 모델 ‘젬마 3’ 공개7∙ 오픈AI, AI 에이전트 구축 지원 도구와 신규 음성·이미지 생성 모델 출시8∙앤스로픽, 트럼프 행정부에 국가 경제와 안보를 고려한 AI 정책 제안9∙ 오픈AI, 트럼프 행정부에 혁신의 자유 강조하는 AI 정책 제안10∙엔비디아, GTC 2025에서 신규 AI 칩 로드맵과 AI 제품군 공개11∙마누스 AI, 완전 자율 AI 에이전트 ‘마누스’ 공개12∙피규어, 휴머노이드 로봇 제조시설 ‘BotQ’ 발표 13∙앱트로닉, 자빌과 전략적 제휴로 휴머노이드 로봇 제작 추진14기술・연구∙구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발16∙사카나 AI의 AI 생성 논문, ICLR 2025 워크숍에서 동료 심사 통과17∙AAAI, 주요 AI 연구 주제와 해결 과제를 정리한 보고서 발간18∙2024년 튜링상, 강화학습 연구에 기여한 연구자 2인이 수상19∙카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개20인력・교육 ∙영국 옥스퍼드⼤ 연구 결과, AI 인력 채용 시 학위보다 실무기술이 중요22∙스탠포드 HAI, AI+교육 서밋에서 AI가 교육에 미치는 영향 논의23∙영국 정부의 AI 저작권 규제 완화 기조에 창작자들의 반발 격화24∙IBM CEO, 가까운 미래에 AI가 프로그래머를 대체할 가능성은 희박하다고 예측25주요행사일정26
| 2025년 4월호 |
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 2, 'page_label': '3'}
| 2025년 4월호 |
정책・법제
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 3, 'page_label': '4'}
SPRi AI Brief2025년 4월호
2
2025년 중국 양회의 정부 업무보고, AI 플러스 행동의 지속 추진을 천명n중국 정부는 2025년 양회의 정부 업무보고를 통해 2024년 처음 제시한 ‘AI 플러스’ 행동을 지속 추진하고 대규모 AI 모델의 광범위한 적용을 지원하겠다는 계획을 발표n2025년 정부 업무보고는 AI 휴대폰과 컴퓨터, 스마트 로봇 등의 차세대 스마트 단말의 개발과 체화 지능의 중요성도 강조했으며, 양회에 참석한 각계 대표들도 AI와 관련된 다양한 제안을 제출
KEY Contents
£중국 정부, ‘AI 플러스’ 행동의 지속 추진 및 대규모 AI 모델의 도입 지원 계획n중국 정부는 2025년 3월 5일 열린 양회(兩會)* 전국인민대표대회 개막식에서 발표한 2025년 정부 업무보고에서 ‘AI 플러스’ 행동의 지속 추진을 천명* 입법기관인 전국인민대표대회(전인대)와 최고 정책 자문기구인 전국인민정치협상회의(정협)∙중국 정부는 2024년 업무보고에서 AI와 실물경제의 통합을 강화하기 위한 ‘AI 플러스’ 개념을 처음 제시했으며, 올해 정부 과제로 디지털 경제 활성화를 위해 “AI 플러스 행동을 지속 추진하고 시장과 제조업에서 디지털 기술의 결합을 강화하며 대규모 AI 모델의 광범위한 적용을 지원”할 계획∙스마트 커넥티드 차량, AI 휴대폰과 컴퓨터, 스마트 로봇, 스마트 제조 장비 등 차세대 스마트 단말을 적극 개발하겠다는 계획도 제시∙업무보고는 또한 ‘신흥산업과 미래산업의 육성과 발전’ 항목에서 미래산업으로 바이오 제조, 양자 기술, 6G와 함께 체화 지능(Embodied Intelligence)*을 포함* 물리적 실체를 갖고 실제 환경과 상호작용하는 AI£양회에 참석한 각계 대표들, AI와 관련된 다양한 제안 제출n중국 관영 언론 글로벌 타임스(Global Times)에 따르면 정부 업무보고에 체화 지능과 대규모 AI 모델이 언급된 것은 올해가 처음이며, 양회에 참석한 각계 대표들도 AI와 관련된 다양한 제안을 제출하는 등, AI가 양회의 핵심 화두로 부상∙정협 위원인 류샹시(劉尚希) 중국 재정과학연구원 전임 원장은 높은 비용과 막대한 투자가 AI 접근성을 제한해 왔다며, 딥시크(DeepSeek) 같은 오픈소스 AI 모델이 AI 접근을 민주화할 것이라고 평가∙정협 위원인 주송춘(朱松纯) 베이징범용AI연구소 원장은 AI 연구소 설립을 추진하는 대학들이 역량 있는 교수진 모집에 어려움을 겪고 있다며 산업의 수요 증가에 대응해 AI 전문가를 지원하는 방안을 제출하겠다고 발언 ∙레이쥔(雷軍) 샤오미(Xiaomi) CEO 겸 전인대 대표는 AI 기반 얼굴 합성과 음성 복제 기술의 남용 억제를 강조하는 한편, 업계의 자정 노력 강화와 AI에 대한 대중 인식 제고를 촉구∙정협 위원인 리징훙(李景虹) 칭화대(清华⼤) 교수는 인재 양성과 고용 보장, 국제 협력, 지식재산권 등 광범위한 AI 문제를 포괄하는 AI 진흥법 도입을 제안출처 | 中国政府网, 最全!50个动态场景看2025《政府⼯作报告》全⽂, 2025.03.05. Global Times, AI in spotlight at China's "two sessions", 2025.03.09.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 4, 'page_label': '5'}
정책・법제기업・산업기술・연구인력・교육
3
중국 정부, 2025년 9월부터 AI 생성·합성물 표시 의무화 규정 시행 예정 발표n중국 국가인터넷정보판공실이 AI 생성·합성물에 명시적 또는 암묵적 표시를 의무화하는 규정을 발표하고 2025년 9월 1일부터 시행할 예정n규정은 대중의 혼란이나 오해를 유발할 수 있는 AI 생성·합성물에는 명시적 표시를 추가하고, 서비스제공자에게 AI 생성·합성물의 파일 메타데이터에 암묵적 표시를 추가할 것을 요구
KEY Contents
£대중의 오해나 착각을 유발할 수 있는 AI 생성· 합성물에 명시적 표시 의무 적용n중국 국가인터넷정보판공실(CAC)이 2025년 3월 14일 공업정보화부, 공안부, 국가광전총국과 공동으로 인터넷 정보 서비스 사업자를 대상으로 AI 생성·합성물에 명시적 또는 암묵적 표시를 의무화하는 「AI 생성·합성 콘텐츠 표시 방법」 규정을 발표하고 2025년 9월 1일부터 시행∙규정에 따르면 AI 생성·합성물에 대한 표시는 사용자가 명확히 인식할 수 있는 명시적 표시와, 파일의 메타데이터에 추가되어 사용자가 쉽게 인식할 수 없는 암묵적 표시로 구분 n인터넷 정보 서비스 사업자가 사람의 텍스트 생성이나 편집을 모방한 지능형 대화나 작문과 같이 대중의 혼돈이나 착각을 유발할 수 있는 AI 생성·합성물*을 제공 시에는 명시적 표시를 추가*텍스트, 오디오, 이미지, 동영상, 가상 장면 등∙일례로 텍스트의 시작, 끝, 또는 중간의 적절한 위치에 텍스트나 일반 기호로 된 표시를 추가하거나 상호작용 가능한 사용자 인터페이스나 텍스트 주변에 명시적 표시를 추가∙AI 생성·합성물 서비스 제공자가 해당 콘텐츠를 다운로드, 복사, 내보내기 등의 방식으로 제공할 경우 명시적 표시가 포함되어 있는지 확인 필요n인터넷 정보 서비스 사업자가 AI 생성·합성물 서비스 제공 시에는 파일 메타데이터*에 △콘텐츠 속성 △서비스 제공자의 명칭이나 코드 △콘텐츠 번호를 포함하도록 디지털 워터마크와 같은 암묵적 표시를 추가* 파일의 출처, 속성, 용도 등 파일에 관한 정보를 담은 데이터n온라인 정보 콘텐츠를 보급하는 서비스 제공자는 AI 생성·합성물 제공 시 다음과 같은 조치를 시행∙파일 메타데이터에 암묵적 표시가 있으면 해당 콘텐츠가 AI 생성·합성물임을 나타내는 명시적 표시를 추가하고, 파일 메타데이터에 암묵적 표시가 없으나 사용자가 AI 생성·합성물임을 밝힌 경우에는 게시된 콘텐츠 주위에 명시적 표시를 추가∙파일 메타데이터에 암묵적 표시가 없고 사용자가 AI 생성·합성물이라고 밝히지 않았으나 AI 생성이나 합성의 다른 흔적을 감지한 경우, AI 생성·합성물로 의심된다는 명확한 경고 표시를 추가 필요n동 규정에 따른 AI 생성·합성물 표시에 대한 악의적 삭제, 조작, 은폐는 금지되며, 이러한 행위를 할 수 있는 도구나 서비스의 제공도 금지 출처 | 国家互联网信息办公室, 关于印发《⼈⼯智能⽣成合成内容标识办法》的通知, 2025.03.14.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 5, 'page_label': '6'}
SPRi AI Brief2025년 4월호
4
인도 전자정보기술부, AI 강국 실현을 위한 AI 로드맵 공개n인도 전자정보기술부가 2047년까지 ‘선진 인도’ 비전과 AI 강국 실현을 위한 다양한 정책을 포괄하는 AI 로드맵을 발표n인도 정부는 2024년 3월 수립한 IndiaAI 미션을 중심으로 AI 컴퓨팅과 반도체 인프라 투자를 강화하는 한편, 데이터 접근성 확대와 AI 전문센터 설립, 자체 AI 모델 개발 등을 추진
KEY Contents
£인도 정부, IndiaAI 미션을 중심으로 AI 역량 구축을 위한 정책 추진n인도 전자정보기술부(MeitY)는 2025년 3월 6일 인도 독립 100년을 맞는 2047년까지 선진국으로 도약하겠다는 ‘선진 인도(Viksit Bharat)’ 비전 달성을 위한 다양한 AI 정책을 소개n(AI 컴퓨팅과 반도체 인프라) 2024년 3월 공개한 IndiaAI 미션*에서 5년간 약 1,030억 루피(한화 약 1조 7천억 원)를 AI 역량 강화에 할당* AI 컴퓨팅 성능 활성화, AI 혁신센터 설립, AI 통합 데이터 플랫폼 등 AI 역량 구축을 위한 국가 전략∙IndiaAI 미션을 통해 18,693개의 GPU를 갖춘 고성능 컴퓨팅 시설 구축을 추진하는 한편, 개방형 GPU 마켓플레이스를 구축해 스타트업과 연구자, 학생에게 컴퓨팅 자원을 지원n(데이터 공유 및 AI 전문센터 설립) 고품질 데이터셋에 대한 접근성을 확대하는 동시에, 학제 간 연구와 산학 협력을 통해 AI 솔루션 개발을 이끌 AI 전문센터(CoE, Center of Excellence)를 설립해 AI 발전을 지원∙IndiaAI 데이터셋 플랫폼을 구축해 스타트업과 연구자에게 고품질의 익명화 데이터셋을 제공하여 AI 모델의 정확성 개선을 지원하는 한편, 뉴델리에 △헬스케어 △농업 △지속 가능한 도시를 중점 연구하는 AI 전문센터 3곳을 설립한 데 이어 추가로 교육 분야에 특화된 AI 전문센터를 설립 예정n(인도의 AI 모델 개발) IndiaAI 미션을 통해 제안 요청을 받아 자체 AI 개발 이니셔티브를 시작하고, 2024년부터 정부 주도의 멀티모달 LLM 개발 프로젝트인 ‘BharatGen’을 진행n(디지털 공공 인프라와 AI 통합) 공공 플랫폼을 기반으로 민간 기업이 분야별 솔루션을 구축하는 방식으로 디지털 공공 인프라(DPI)와 AI의 통합을 확대∙일례로 2025년 1월 열린 인도의 대표적 힌두교 행사 마하쿰브에서 AI 기반 분석 도구로 철도 승객 흐름을 실시간 모니터링하여 군중 분산을 유도하고 AI 챗봇을 활용해 분실물 서비스, 실시간 번역, 다국어 서비스를 지원n(AI 인력 양성) 교육과 기술 개발에 대한 지속적 투자를 위해 AI 과목을 포함하도록 대학 커리큘럼을 개편∙‘IndiaAI Future Skills’ 이니셔티브를 통해 학부, 대학원, 박사 과정 전반으로 AI 교육을 확대하는 한편, 중소도시에 데이터 및 AI 연구소를 설립해 접근성을 확대n(실용적 규제) 법률에만 의존하기보다 주요 대학과 연구소에 대한 자금 지원을 통해 딥페이크, 개인정보 유출, 사이버 위협에 대응한 기술 솔루션을 개발하는 실용적인 규제 접근방식을 채택출처 | Ministry of Electronics & IT, India’s AI Revolution- A Roadmap to Viksit Bharat, 2025.03.06.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 6, 'page_label': '7'}
정책・법제기업・산업기술・연구인력・교육
5
영국 경쟁시장청, 마이크로소프트와 오픈AI 협력 관련 반독점 조사 종료 발표n영국 경쟁시장청이 14개월에 걸친 마이크로소프트와 오픈AI의 파트너십에 대한 반독점 조사를 종료하고 마이크로소프트가 오픈AI에 실질적 지배권을 행사하지 않았다는 결론을 제시n그러나 EU는 양사의 파트너십을 계속 주시하기로 했으며 미국 연방거래위원회(FCC)도 2024년 양사를 포함한 주요 AI 기업에 대한 조사에 착수하는 등, 규제 이슈는 지속
KEY Contents
£영국 경쟁시장청, 마이크로소프트가 오픈AI에 실질적 지배권 행사하지 않았다고 평가 n영국 경쟁시장청(CMA)이 2025년 3월 5일 마이크로소프트(Microsoft)와 오픈AI(OpenAI)의 협력 관계에 대한 반독점 조사를 종료한다고 발표∙마이크로소프트는 오픈AI의 최대 투자자로서, 2019년 오픈AI와 파트너십을 맺고 2024년까지 130억 달러 이상을 투자했으며, 이에 CMA는 2023년 12월 양사의 파트너십이 영국 내 시장 경쟁을 저해할 수 있는 사실상의 합병으로 보아야 하는지에 대한 조사에 착수∙CMA는 14개월에 걸친 조사 결과, 마이크로소프트가 오픈AI에 대한 실질적인 영향력을 확보했으나 지배권 변동이 없으므로 인수합병 규정*에 따른 전면 조사의 대상이 되지 않는다는 결론을 제시* 영국 기업법(Enterprise Act 2002) 제22조(완결된 합병과 관련된 심층 조사 회부 의무)nCMA의 조엘 뱀포드(Joel Bamford) 합병 담당 이사는 2025년 3월 5일 비즈니스 소셜미디어 플랫폼 링크드인(Linked in) 게시글*을 통해 마이크로소프트가 오픈AI에 실질적인 지배권을 행사하지 않아 현재 형태의 파트너십이 영국의 합병 통제 제도에 따른 검토 대상이 되지 않는다고 설명* What are the key takeaways from our review of the Microsoft/OpenAI partnership?, Joel Bamford, 2025.03.05.∙그는 마이크로소프트가 2025년 1월 오픈AI에 대한 컴퓨팅 용량 공급 관련 계약상 권리를 독점 공급에서 우선협상권으로 변경하면서 오픈AI의 의존도가 감소한 점도 언급했으며, 파트너십의 복잡성과 계약 조건의 변화 및 계약의 실제 운영 방식 등을 검토하는 과정에서 조사에 이례적으로 오랜 기간이 걸렸다고 설명£EU와 미국의 규제당국은 여전히 마이크로소프트와 오픈AI의 파트너십 주시n마이크로소프트와 오픈AI의 파트너십에 대한 CMA의 승인에도, EU와 미국 등 주요국 규제당국은 여전히 양사의 관계에 주목∙EU 집행위원회는 2024년 양사의 파트너십에 대한 정식 조사는 불필요하다는 결론을 내렸으나 양사의 관계를 계속 주시하기로 했으며, 미국 연방거래위원회(FCC)는 2024년 양사를 포함한 주요 AI 기업들의 생성 AI 파트너십에 대한 조사에 착수∙이에 마이크로소프트는 2024년 오픈AI 이사회의 옵저버 역할을 포기하는 등, 오픈AI에 대한 영향력 축소를 시도출처 | Competition and Markets Authority, Microsoft / OpenAI partnership merger inquiry, 2025.03.05.The Wall Street Journal, Microsoft-OpenAI Partnership Gets U.K. Antitrust Clearance, 2025.03.05.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 7, 'page_label': '8'}
| 2025년 4월호 |
기업・산업
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 8, 'page_label': '9'}
정책・법제기업・산업기술・연구인력・교육
7
구글, 단일 GPU로 구동 가능한 오픈소스 AI 모델 ‘젬마 3’ 공개n구글이 휴대 단말에서 단일 GPU나 TPU로 구동할 수 있는 오픈소스 AI 모델 ‘젬마 3’를 매개변수 1B, 4B, 12B, 27B의 4개 버전으로 공개n구글에 따르면 젬마 3는 챗봇 아레나의 인간 선호도 평가에서 라마3-405B, 딥시크-V3, o3-미니를 능가하는 것으로 나타나 크기 대비 최고의 성능을 발휘
KEY Contents
£젬마 3, 텍스트와 시각적 추론 및 최대 128K 토큰의 컨텍스트 창 지원n구글(Google)이 2024년 3월 12일 ‘제미나이(Gemini) 2.0’ 모델 아키텍처 기반의 경량 오픈소스 AI 모델 ‘젬마 3(Gemma 3)’를 공개∙스마트폰과 노트북 같은 단말에서 단일 GPU나 TPU*로 실행할 수 있는 젬마 3는 매개변수 1B, 4B, 12B, 27B의 4개 버전으로 제공되어 개발자들이 하드웨어나 성능 요구사항에 맞게 모델을 선택 가능* 구글에서 개발한 머신러닝 전용 프로세서로, 일반 GPU보다 머신러닝 작업에서 뛰어난 성능과 전력 효율성을 보유∙젬마 3는 140개 이상의 언어와 고급 텍스트 이해 및 시각 정보 추론을 지원하고, 최대 12만 8천 개 토큰의 컨텍스트 창 및 작업 자동화와 에이전트 구축을 위한 함수 호출 기능과 구조화된 출력을 제공하며, 양자화* 버전을 통해 모델 크기와 컴퓨팅 요구사항을 줄이면서 높은 정확도를 유지* 모델의 매개변수를 저장하는 데 필요한 비트 수를 줄여 모델 크기를 압축하고 연산 속도를 높이는 기술∙구글은 젬마 3가 챗봇 아레나(Chatbot Arena)* 인간 선호도 평가에서 1338점으로 매개변수가 훨씬 큰 모델인 라마3-405B(1269점), 딥시크-V3(1318점), o3-mini(1304점)를 능가했다는 점에서 크기 대비 최고의 성능을 발휘했다고 주장* 사용자 선호도를 통해 AI 모델을 평가하는 오픈소스 플랫폼
<젬마 3와 주요 AI 모델의 챗봇 아레나 점수 비교>
n구글은 젬마 3에 대한 광범위한 데이터 거버넌스 및 미세조정, 벤치마크 평가를 통해 안전성을 높이는 한편, 젬마 3를 기반으로 이미지 안전성을 검사하는 솔루션 ‘쉴드젬마(ShieldGemma) 2’도 출시∙쉴드젬마 2는 △위험한 콘텐츠 △노골적인 성적 표현 △폭력 등 세 가지 범주에서 안전 라벨을 제공하여 유해 콘텐츠 필터링을 지원출처 | Google, Introducing Gemma 3: The most capable model you can run on a single GPU or TPU, 2025.03.12.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 9, 'page_label': '10'}
SPRi AI Brief2025년 4월호
8
오픈AI, AI 에이전트 구축 지원 도구와 신규 음성·이미지 생성 모델 출시n오픈AI가 AI 에이전트의 효율적 구축을 지원하는‘Response API’와 다중 에이전트 기반의 업무 프로세스 조율을 지원하는 ‘에이전트 SDK’를 출시n오픈AI는 개발자 대상으로 API에서 음성인식 및 음성합성 모델 3종을 공개하는 한편, GPT-4o를 기반으로 텍스트와 이미지 생성을 통합한 AI 모델도 공개
KEY Contents
£오픈AI의 Response API, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 지원 n오픈AI가 2025년 3월 11일 개발자의 효율적인 AI 에이전트 구축을 지원하는 ‘Response API’를 공개∙Response API는 여러 API나 외부 공급업체를 사용하지 않고 오픈AI의 모델과 기본 제공 도구를 앱에 쉽게 결합하려는 개발자를 위한 API로, 웹 검색, 파일 탐색, 컴퓨터 사용(Computer Use)*등 기능을 지원* 브라우저 기반의 실제 작업(예: 파일 다운로드, 웹 검색 등)을 수행할 수 있는 오픈AI의 에이전트 기능∙오픈AI는 대화형 응답을 생성하는 ‘Chat Completions API’ 및 AI 어시스턴트 생성과 관리를 지원하는 ‘Assistants API’의 기능을 결합해 Response API를 출시했으며, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 통해 AI 모델이 현실의 복잡한 작업을 수행할 수 있다고 설명n오픈AI는 Response API와 함께 개발자가 다중 에이전트 기반의 업무 프로세스 조율을 간소화할 수 있도록 지원하는 ‘에이전트 SDK*’도 공개* Software Development Kit: 특정 플랫폼이나 API를 쉽게 사용할 수 있도록 제공하는 도구 모음∙오픈AI는 2024년 10월 공개한 실험적 SDK ‘Swarm’을 바탕으로 LLM의 손쉬운 구성, 에이전트 간 지능적 연계 지원, 안전 가드레일 적용 등의 개선 사항을 적용해 에이전트 SDK를 출시£오픈AI, 신규 음성인식·음성합성과 이미지 생성 모델 출시 n오픈AI는 2025년 3월 20일 API로 음성인식(Speech-to-Text) 모델 ‘gpt-4o-transcribe’ 및 ‘gpt-4o-mini-trasncribe’와 음성합성(Text-to-Speech) 모델 ‘gpt-4o-mini-tts’를 출시∙이 모델들은 악센트, 소음이 있는 환경과 같은 까다로운 조건에서도 높은 정확도를 유지하는 것이 특징으로, 특히 음성인식 모델은 기존 ‘위스퍼(Whisper)’ 모델 대비 단어 오류율(WER)이 크게 개선 n오픈AI는 2025년 3월 25일 텍스트와 이미지 생성 기능을 통합해 더욱 정확하고 사실적인 이미지를 생성하는 ‘GPT-4o 이미지 생성(Image Generation)’ 모델도 출시∙오픈AI에 따르면 GPT-4o에서 이미지 생성 기능이 기본으로 제공되므로 GPT-4o의 지식 베이스와 대화 맥락을 활용해 사용자 요구를 세밀하게 반영한 이미지를 생성하며 이미지에 삽입되는 텍스트 품질도 크게 개선∙GPT-4o 이미지 생성 모델은 챗GPT의 기본 이미지 생성기로 유료 사용자뿐 아니라 무료 사용자에게도 제공되며, 개발자를 위한 API 접근도 몇 주 안에 지원될 예정출처 | OpenAI, New tools for building agents, 2025.03.11.OpenAI, Introducing 4o Image Generation, 2025.03.25.OpenAI, Introducing next-generation audio models in the API, 2025.03.20.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 10, 'page_label': '11'}
정책・법제기업・산업기술・연구인력・교육
9
앤스로픽, 트럼프 행정부에 국가 경제와 안보를 고려한 AI 정책 제안n앤스로픽은 경제와 국가안보에 막대한 영향력을 미칠 AI 기술에서 미국이 주도권을 유지하기 위해 트럼프 행정부가 중점적으로 추진해야 할 6가지 핵심 영역을 제안n앤스로픽은 AI 모델에 대한 국가안보 테스트의 강화와 첨단 반도체의 수출 통제 강화, AI 연구소 보안 강화, 에너지 인프라 확장, 정부의 AI 도입 촉진, AI의 경제적 영향 대비를 권고
KEY Contents
£앤스로픽, AI 모델에 대한 국가안보 테스트와 첨단 반도체 수출 통제를 요구 n앤스로픽은 2025년 3월 6일 트럼프 행정부를 대상으로 AI가 국가 경제와 안보에 미치는 영향을 중점 고려한 AI 정책 권고안을 발표∙미국의 AI 리더십을 강화할 ‘AI 행동계획(AI Action Plan)’ 수립을 요구한 트럼프 대통령이 AI 행정명령 이행을 위해 백악관 과학기술정책실(OSTP)이 진행한 공개 의견 요청*에 대한 응답으로 정책을 제안* 미국의 AI 우위 유지와 강화에 필요한 정책 우선순위 수립 및 민간 혁신을 저해하는 규제 부담 해소를 위해 AI 행동계획에 우선 포함되어야 할 조치에 대하여 2025년 2월 6일부터 3월 15일까지 의견수렴을 진행 ∙앤스로픽은 2026년 후반이나 2027년 초에 ‘강력한 AI 시스템’*이 출현할 것으로 예상하며, AI가 경제와 국가안보에 미칠 막대한 영향력에 대비해 미국이 리더십을 유지하기 위한 단호한 정책 대응을 요구* 노벨상 수상자 수준의 지적 능력, 인간과 동등한 수준의 인터페이스 탐색 능력과 복잡한 작업의 자율적 추론 능력, 물리적 세계와 상호작용하는 능력을 갖춘 AI 시스템을 의미n앤스로픽은 AI가 경제와 국가안보에 미치는 영향을 고려하고 미국의 국익을 극대화하기 위해 중점을 두어야 할 6가지 핵심 정책 영역을 제시∙(국가안보 테스트 강화) 정부 기관은 국내외 AI 모델이 국가안보에 미치는 잠재적 영향을 평가할 수 있도록 표준 평가 프레임워크 수립, 안전한 테스트 인프라 구축, AI 시스템의 취약점을 분석할 수 있는 전문팀 구성과 같은 역량을 개발∙(첨단 반도체 수출 통제 강화) 미국과 동맹국이 강력한 AI 시스템의 이점을 누리는 동시에 중국 등의 적대국이 첨단 AI 인프라에 접근할 수 없도록 엔비디아 H20 칩*을 포함한 첨단 반도체 수출제한을 강화하며, 중국의 AI 칩 밀수를 방지하기 위한 정부 간 협정을 추진* 미국 수출 규제를 준수하며 중국 시장용으로 특별히 설계된 저사양 칩으로 H100 대비 연산 성능이 5분의 1 수준∙(AI 연구소 보안 강화) AI의 전략적 자산화를 고려해 AI 연구소와 정보기관 간 기밀 커뮤니케이션 채널을 구축하고, AI 전문가에 대한 보안 허가를 신속히 처리하며, AI 인프라용 차세대 보안 표준을 개발∙(에너지 인프라 확장) AI 개발을 지속적으로 선도하기 위해 2027년까지 50기가와트 규모의 AI 전용 전력을 추가 확보하고, 에너지 인프라 구축을 위한 허가와 승인 절차를 간소화∙(정부의 AI 도입 촉진) 정부 차원에서 AI 도입으로 혜택을 누릴 수 있는 업무 목록을 정리하고, 각 기관 책임자에게 AI가 공익에 크게 기여할 수 있는 프로그램 수립을 요구 ∙(AI의 경제적 영향 대비) AI의 도입 추세와 이에 따른 경제적 영향을 더욱 잘 파악할 수 있도록 인구조사국 조사와 같은 경제 데이터의 수집 체계를 개선하고, 이를 통해 AI로 인한 구조적 변화에 대비출처 | Anthropic, Anthropic’s Recommendations to OSTP for the U.S. AI Action Plan, 2025.03.06.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 11, 'page_label': '12'}
SPRi AI Brief2025년 4월호
10
오픈AI, 트럼프 행정부에 혁신의 자유 강조하는 AI 정책 제안n오픈AI는 트럼프 행정부를 대상으로 한 AI 정책 제안에서 혁신의 자유를 보장하기 위해 연방 정부와 민간 부문 간 자율적 협력 체제를 수립할 것을 권고n오픈AI는 또한 민주주의 원칙에 따른 AI 칩과 시스템 수출 통제 및 학습의 자유를 증진하는 저작권 체계 수립, 인프라 투자, 정부의 AI 도입 확대를 요구
KEY Contents
£오픈AI, 연방 정부와 민간 부문 간 자율적 협력 체제를 통한 혁신의 자유 요구n오픈AI가 트럼프 행정부의 ‘AI Action Plan’ 수립을 위한 백악관 과학기술정책실(OSTP)의 의견 요청에 대응해 2025년 3월 13일 혁신의 자유를 강조하는 정책 제안을 제출∙정책 제안은 혁신의 자유를 보장하는 규제 접근방식과 민주적 AI 원칙에 따른 수출 통제, 학습의 자유를 증진하는 저작권 체계, 인프라 기회 포착, 정부의 AI 도입 확대를 포괄n(혁신의 자유 보장) 국가안보를 강화하기 위해 연방 정부와 민간 부문 간 자율적 협력 체제를 수립하고, 주 정부의 파편화된 AI 규제로부터 AI 기업을 보호 ∙여러 주에서 발의한 AI 관련 법안으로 인한 규제 준수 부담이 중국에 반사이익이 되지 않도록, AI 기업이 연방 정부와 소통할 수 있는 단일 창구를 마련해 규제 불확실성을 제거하고 혁신의 자유를 보장n(민주주의 원칙에 따른 수출 통제) 글로벌 AI 시장에서 민주주의 원칙을 따르는 국가에는 미국산 AI 시스템의 도입을 장려하고, 중국 및 중국에 동조하는 소수 국가에는 수출을 통제∙중국 및 미국 무기 금수조치가 적용되는 국가들에는 첨단 칩에 대한 기존 수출 통제를 포함해 AI 시스템에 대한 엄격한 수출 통제 시행 강조n(학습의 자유를 증진하는 저작권 체계) 미국의 AI 리더십과 경제 및 국가안보를 지원하는 저작권 체계 수립을 위한 조치를 채택∙중국의 기술적 우위를 막기 위해 AI에 공정사용* 원칙을 적용하고, 미국 기업들의 데이터 접근권을 보장하기 위한 국제 정책 논의를 진행하며, 정부가 보유하거나 지원하는 데이터 접근성을 확대* Fair Use: 저작권자 허락 없이도 언론 보도나 교육 목적 등으로 콘텐츠 사용을 허용하는 원칙n(성장을 촉진하는 인프라 기회 포착) 중국과의 AI 주도권 경쟁에 필요한 인프라에 투자함으로써 경제 성장과 AI 접근성 극대화, 민감한 미국 데이터의 자국 내 저장을 실현해 국가안보 이익을 보호∙에너지 인프라에 대한 계획과 허가 절차를 간소화하여 인프라 건설을 촉진하고, 공립대학에 AI 기업의 컴퓨팅 자원을 제공해 AI 전문 인력의 양성을 지원n(정부의 AI 도입 확대) 전 세계적으로 민주적 AI가 발전하려면 미국 정부가 국민의 안전과 번영, 자유를 위해 AI를 사용하는 모범을 보여야 하며, 정부의 AI 도입을 강화하기 위한 공공-민간 파트너십을 통해 AI 도입 절차를 간소화하고 신속한 AI 조달 체계를 마련 출처 | OpenAI, OpenAI’s proposals for the U.S. AI Action Plan, 2025.03.13.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 12, 'page_label': '13'}
정책・법제기업・산업기술・연구인력・교육
11
엔비디아, GTC 2025에서 신규 AI 칩 로드맵과 AI 제품군 공개n엔비디아가 GTC 2025에서 AI 칩 로드맵을 공개하며, 2025년 하반기 블랙웰 울트라에 이어 2026년 하반기에 새로운 아키텍처의 ‘베라 루빈’을 출시하겠다고 발표n엔비디아는 피지컬 AI에 주목하며 휴머노이드 로봇용 개방형 기반모델 ‘아이작 그루트 N1’을 공개하는 한편, AI 에이전트 개발을 위한 오픈소스 모델 ‘라마 네모트론’도 함께 발표
KEY Contents
£엔비디아, 신규 AI 칩 로드맵 및 피지컬 AI와 AI 에이전트 관련 신제품 발표n엔비디아(Nvidia)가 2025년 3월 17~21일 미국 새너제이에서 열린 연례 개발자 회의 GTC 2025에서 향후 출시할 AI 칩 로드맵을 포함해 다양한 AI 신제품군을 소개∙젠슨 황(Jensen Huang) 엔비디아 CEO는 2025년 3월 18일 기조연설을 통해 AI 시장 전망을 제시하며 추론 모델과 AI 에이전트의 부상으로 AI 컴퓨팅 수요가 빠르게 증가하는 한편, AI 워크로드의 확장과 복잡성 증가로 인해 전 세계 데이터센터 투자가 급증하고 있다고 설명 n엔비디아는 2024년 출시한 GPU ‘블랙웰(Blackwell)’의 업그레이드 버전 ‘블랙웰 울트라’를 올해 하반기에 출시하고, 2026년 하반기에 새로운 아키텍처의 AI 칩 ‘베라 루빈(Vera Rubin)’을 출시 예정∙최대 288GB의 고대역폭 메모리를 탑재한 블랙웰 울트라는 블랙웰보다 1.5배 더 높은 AI 성능을 제공하며, AI 모델의 추론과 훈련을 더욱 정교하게 수행할 수 있도록 설계 ∙블랙웰의 뒤를 잇는 새로운 아키텍처의 베라 루빈은 ‘베라(Vera)’라는 맞춤형 설계 CPU를 탑재하게 되며, 2027년 하반기에는 성능과 메모리가 개선된 루빈 울트라를, 2028년에는 ‘파인만(Feynman)’을 출시 예정n엔비디아는 AI 기반 로보틱스와 자동화와 같은 피지컬 AI(Physical AI)가 장차 50조 달러 규모의 시장 기회를 형성할 것으로 예상하며, 휴머노이드 로봇용 AI 모델 ‘아이작 그루트 N1(Isaac GR00T N1)’을 발표 ∙아이작 그루트 N1은 휴머노이드 로봇을 위한 세계 최초의 개방형 기반모델로, 로봇이 다양한 작업을 수행할 수 있도록 사전훈련된 상태로 제공되며, 특정 목적에 맞게 추가 학습을 진행할 수 있도록 설계∙엔비디아는 구글 딥마인드, 디즈니 리서치와 함께 로봇이 복잡한 작업을 정밀하게 처리하는 방법을 학습할 수 있도록 지원하는 오픈소스 물리엔진 ‘뉴튼(Newton)’도 개발 중이라고 설명∙엔비디아는 AI를 가장 먼저 도입한 분야로 자율주행차량을 꼽으면서 차세대 자동차와 공장, 로봇 개발에서 GM과의 협력을 소개하는 한편, 자율주행차량 종합 안전 시스템 ‘헤일로스(Halos)’도 발표n엔비디아는 이번 행사에서 개발자와 기업을 대상으로 추론 기능을 갖춘 오픈소스 AI 모델 ‘라마 네모트론(Llama Nemotron)’ 제품군도 공개∙메타의 라마 모델을 기반으로 구축된 라마 네모트론은 복잡한 작업을 해결할 수 있는 AI 에이전트 구축을 위한 모델로, 엔비디아는 사후 훈련을 통해 다단계 수학, 코딩, 추론 및 복잡한 의사 결정 능력을 개선출처 | Nvidia, GTC 2025 – Announcements and Live Updates, 2025.03.20.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 13, 'page_label': '14'}
SPRi AI Brief2025년 4월호
12
마누스 AI, 완전 자율 AI 에이전트 ‘마누스’ 공개n중국의 AI 스타트업 마누스 AI가 다양한 작업을 인간의 개입 없이 독립적으로 실행할 수 있는 완전 자율 AI 에이전트 ‘마누스’를 발표하고 초대 시스템을 통해 일부 사용자에게 제공n마누스는 앤스로픽 클로드와 알리바바 큐원 등 기존 LLM을 활용한 다중 에이전트 시스템으로 설계되었으며, 최초의 완전 자율 AI 에이전트라는 점에서 제2의 딥시크라는 평가도 존재
KEY Contents
£마누스 AI, 인간의 개입 없이 독립적으로 작업 수행하는 AI 에이전트 발표 n중국 AI 스타트업 마누스 AI(Manus AI)가 2025년 3월 5일 유튜브와 전용 웹사이트를 통해 완전 자율 AI 에이전트 ‘마누스’를 공개∙마누스 AI는 전용 웹사이트(Manus.im)에서 마누스가 “사고와 행동을 연결하는 세계 최초의 범용 AI 에이전트로, 업무와 일상의 다양한 작업에서 뛰어난 능력을 발휘”한다고 주장∙웹사이트에 소개된 활용 사례에 따르면 마누스는 여행계획 수립, 부동산 조사, 보험 정책 비교 등 다양한 작업을 인간의 개입 없이 독립적으로 수행하며, 일례로 이력서 파일을 받으면 후보자 순위 결정을 넘어 후보자들의 보유 기술을 추출하고 일자리 동향과 교차 참조하여 최적화된 채용 결정을 제시∙마누스 AI는 마누스가 GAIA(General AI Assistants)* 벤치마크 테스트에서 오픈AI의 딥 리서치를 능가하는 최고 점수를 달성했다고 보고*** AI 모델의 추론, 멀티모달 처리, 웹 브라우징, 도구 사용 등 복잡한 능력을 평가하는 벤치마크로 3가지 난이도로 구성** (GAIA 레벨별 성능 비교) Level 1: Manus.ai 86.5%, OpenAI Deep Research 74.3%/Level 2: Manus.ai 70.1%, OpenAI Deep Research 69.1%/Level 3 : Manus.ai 57.7%, OpenAI Deep Research 47.6% ∙마누스는 초대 코드를 통해서만 접근을 허용하는 비공개 테스트 단계로, 마누스 AI는 서버 용량 제한으로 인해 초대 시스템이 불가피하며 이를 해결하기 위해 노력 중이라고 설명n미국 경제매체 포브스(Forbes)는 마누스가 “인간의 조수에 그치지 않고 인간을 대체하는 세계 최초의 완전 자율 AI 에이전트”라며, 제2의 딥시크라고 평가했으나 부정적인 평가도 존재∙포브스에 따르면 마누스는 앤스로픽 클로드(Claude)와 알리바바 큐원(Qwen)과 같은 기존 LLM 기반 다중 에이전트 시스템으로 설계되어 복잡한 작업을 구성 요소별로 나누어 적절한 에이전트에 할당하고 진행 상황을 감독하며, 사용자의 개입 없이 백그라운드에서 작업을 수행한 뒤 완료되면 사용자에게 안내∙일부 초기 테스터 사이에서 정보 검색 실수와 시스템 다운을 비롯한 마누스의 오류나 단점에 대한 지적도 나오고 있으나, 포브스는 정식 출시에 앞서 시스템이 개선될 것으로 예상∙그러나 미국의 IT 미디어 테크크런치(TechCrunch)는 마누스가 사용자에게 잘못된 답변을 제시하거나 주문이나 예약 프로세스에 종종 실패하는 등 잦은 오류를 보였으며, 딥시크와 달리 자체적으로 모델을 개발하지도 않았다며 제2의 딥시크라는 표현은 과장되었다고 지적출처 | Manus AI, Introducing Manus: The General AI Agent, 2025.03.05. Forbes, China’s Autonomous Agent, Manus, Changes Everything, 2025.03.08.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 13, 'page_label': '14'}
TechCrunch, Manus probably isn’t China’s second ‘DeepSeek moment’, 2025.03.09.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 14, 'page_label': '15'}
정책・법제기업・산업기술・연구인력・교육
13
피규어, 휴머노이드 로봇 제조시설 ‘BotQ’ 발표 n피규어가 자체 생산이 가능한 휴머노이드 로봇 제조시설 BotQ를 공개하고 올해 안에 자체 휴머노이드 로봇을 BotQ의 제조 공정에 투입해 자동화 수준을 높일 계획n피규어는 휴머노이드 로봇 양산을 위해 로봇 아키텍처 재편, 공급망 구축, 제조팀 구성, 소프트웨어 인프라 구축, 로봇 자동화 등을 통해 대량생산이 가능한 확장형 제조시설을 구축했다고 강조
KEY Contents
£피규어, 연간 1만 2천 대의 휴머노이드 로봇을 생산할 수 있는 제조시설 구축n미국 휴머노이드 로봇 스타트업 피규어(Figure)가 2025년 3월 15일 연간 최대 1만 2천 대의 로봇을 생산할 수 있는 휴머노이드 로봇 제조시설 ‘BotQ’를 공개∙피규어는 휴머노이드 로봇을 자체 생산함으로써 제작 공정과 품질을 통제하여 고성능 로봇을 시장에 출시할 수 있을 것으로 기대 ∙올해 안에 자체 휴머노이드 로봇을 BotQ의 제조 공정에 투입할 계획으로, 휴머노이드 로봇 투입을 점진적으로 늘려 생산 설비의 자동화 수준을 향상할 예정 n피규어는 휴머노이드 로봇의 아키텍처 재편, 공급망 구축, 전문 제조팀 구성, 소프트웨어 인프라 구축, 로봇 자동화 등을 통해 확장성 있는 제조시설을 건설∙피규어가 2024년 8월 공개한 2세대 휴머노이드 로봇 ‘피규어 02’는 고도의 정밀성을 요구하여 복잡하고 속도가 느린 컴퓨터 수치 제어(CNC)* 공정을 주로 사용했으나, 차세대 ‘피규어 03’ 설계 시에는 사출 성형 방식**으로 전환해 CNC 기계로 일주일 이상 소요되던 부품 생산을 강철 금형으로 20초 이내에 완료* Computer Numerical Control: 컴퓨터를 사용하여 공작 기계를 자동 제어하는 기술 ** 고분자 재료를 녹여 금형에 주입한 후 냉각시켜 제품을 대량으로 생산하는 제조 공정∙피규어는 로봇 아키텍처를 재편하면서 안전팀과 신뢰성 팀을 새로 구성했으며, 신뢰성 팀은 로봇 수명을 빠르게 평가할 수 있는 가속 수명주기 테스트를 통해 로봇의 신뢰성 지표 달성을 위한 개선 사항을 도출 ∙공급망 구축에서는 핵심 기술(액추에이터, 로봇 핸드, 배터리, 최종 조립)은 내부에서 확보하고 필요시 외부 공급업체를 활용하는 방식으로 향후 4년 내 휴머노이드 로봇 10만 개, 액추에이터 300만 개까지 생산 규모 확장이 가능해질 전망∙제조설비 설계와 최적화에 전문성을 갖춘 제조팀을 구성하고 품질과 속도 등의 지표를 반영해 단기적으로 자동화할 핵심 공정을 선택함으로써 생산 주기를 단축∙소프트웨어 인프라에서는 제품 수명주기 관리(PLM) 시스템, 전사적 자원관리(ERP) 시스템, 창고관리 시스템(WMS)과 함께 맞춤형 제조 실행 시스템(MES)*을 도입해 공급망을 통한 부품 추적에서 품질관리까지 전체 생산 절차를 효율적으로 운영* 제조 현장에서 생산 계획, 작업 지시, 품질관리 등 생산 활동을 실시간으로 관리하고 제어하는 시스템∙피규어는 자사 제조공정에 휴머노이드 로봇 자동화를 통합하고, AI 기반 자동화 시스템과 인간의 감독을 결합해 로봇으로 로봇을 제작하여 생산 일정을 가속화하고 미래의 자율 제조 실현을 위한 기반을 마련출처 | Figure, BotQ: A High-Volume Manufacturing Facility for Humanoid Robots, 2025.03.15.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 15, 'page_label': '16'}
SPRi AI Brief2025년 4월호
14
앱트로닉, 자빌과 전략적 제휴로 휴머노이드 로봇 제작 추진n앱트로닉이 자빌과 전략적 제휴를 체결하고 자빌의 제조 공정에 휴머노이드 로봇 ‘아폴로’를 시범 배치해 검증 테스트를 진행한다고 발표n앱트로닉은 휴머노이드 로봇 핵심 부품의 단가를 절감하고 자빌을 통해 양산 능력을 확보함으로써 제작 비용을 낮춰 산업용을 시작으로 의료, 가정 등으로 응용 분야를 확대할 계획
KEY Contents
£자빌, 앱트로닉의 휴머노이드 로봇 제작 및 자사 제조 공정에 시범 도입 예정n미국 휴머노이드 로봇 기업 앱트로닉(Apptronik)이 2025년 2월 25일 글로벌 엔지니어링 및 제조, 공급망 솔루션 기업 자빌(Jabil)과 전략적 제휴를 발표∙자빌은 앱트로닉의 휴머노이드 로봇 ‘아폴로(Apollo)’를 제작하고 이를 자사 제조 공정에 활용하는 시범 프로젝트를 진행할 계획∙앱트로닉은 아폴로를 고객 현장에 배치하기에 앞서 자빌의 제조 공정에서 검사, 분류, 라인 내 물류 배송, 부품 조립과 같은 단순하고 반복적인 작업을 통한 검증 테스트를 시행할 예정∙자빌과 앱트로닉은 실제 생산 환경에 아폴로를 도입함으로써 기존 인력의 작업을 보완하는 한편, 제조 자동화와 아폴로의 AI 모델 최적화를 위한 실제 사용 사례를 수집할 수 있을 것으로 기대n앱트로닉은 휴머노이드 로봇의 대량 보급을 위해 핵심 부품인 액추에이터의 단가를 절감한 데 이어 자빌을 통해 확보한 양산 능력을 바탕으로 제작 비용을 낮춰 소매 업장이나 노인 돌봄, 궁극적으로는 가정으로 시장을 확장할 계획∙앱트로닉은 삶의 모든 측면에서 인간을 지원하는 휴머노이드 로봇 제작을 기업 목표로 제시했으며, 우선 제조와 물류 같은 중요 산업에서 시작해 의료, 가정까지 로봇 응용 분야를 확대할 예정
<앱트로닉의 휴머노이드 로봇 ‘아폴로’>
출처 | Jabil, Apptronik and Jabil Collaborate to Scale Production of Apollo Humanoid Robots and Deploy in Manufacturing Operations, 2025.02.25.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 16, 'page_label': '17'}
| 2025년 4월호 |
기술・연구
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 17, 'page_label': '18'}
SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 18, 'page_label': '19'}
정책・법제기업・산업기술・연구인력・교육
17
사카나 AI의 AI 생성 논문, ICLR 2025 워크숍에서 동료 심사 통과n사카나 AI는 자사의 ‘AI 사이언티스트’가 인간의 개입 없이 전적으로 생성한 논문이 ICLR 2025 워크숍에서 동료 심사를 통과했다고 발표n사카나 AI는 해당 논문이 정규 학회 수준에는 미치지 못하며 내부 검토에서도 일부 오류가 발견되었다고 한계를 밝히는 한편, AI 생성 과학 연구에 대한 규범의 필요성을 강조
KEY Contents
£AI 사이언티스트로 생성된 논문 3편 중 1편이 ICLR 2025 워크숍 동료 심사 통과n일본 AI 스타트업 사카나 AI(Sakana AI)가 2025년 3월 12일 자사의 ‘AI 사이언티스트(AI Scientist)’로 생성된 논문이 국제 AI 학술대회 워크숍의 동료 심사(Peer-Review)를 통과했다고 발표∙사카나 AI는 2024년 8월 과학 연구를 자동화하는 ‘AI 사이언티스트’를 공개했으며, 이를 개선한 v2 버전으로 생성된 논문을 AI 분야의 대표적 학술대회인 ICLR 2025 워크숍에 제출∙AI 사이언티스트-v2는 과학적 가설 제안, 가설을 검증할 실험 제안, 실험 수행을 위한 코드 작성과 개선, 실험 수행, 데이터 분석과 시각화를 포함해 전체 과학 논문을 인간의 도움 없이 처음부터 끝까지 작성∙사카나 AI는 연구 수행을 위한 대략적인 주제만 제공하여 생성된 총 3편의 AI 생성 논문을 사전 협의 후 ICLR 워크숍에 제출했으며, 이 중 1편이 동료 심사를 통과했다고 설명∙동료 심사에서 통과된 논문은 신경망 훈련 기법에 관한 내용을 다루고 있으며, 심사 평점은 6.33점으로 제출된 전체 논문의 상위 45% 수준을 기록 £사카나 AI의 내부 검토 결과, AI 생성 논문의 품질은 정규 학회 수준에는 미달n사카나 AI는 투명성과 윤리를 고려해 동료 심사 통과 후 논문을 철회했기에, ICLR 주최 측이 논문에 대한 메타 심사*를 진행하지 않았으나 이론적으로 메타 심사 단계에서 논문이 거부되었을 가능성이 있다고 부연* 개별 심사자들의 의견을 종합하여 최종 평가를 제공하는 심사 과정∙또한 ICLR 학회의 논문 수락률이 통상 20~30% 수준이나 학회에서 개최하는 워크숍의 수락률은 60~70%에 달한다며, 내부 검토 결과 AI 생성 논문 3편 모두 정규 학회 수준에는 도달하지 못했다고 한계를 인정∙사카나 AI의 내부 검토에서는 AI 생성 논문에서 그림이나 인용 누락, 서식 문제 등의 오류가 확인되었으며, 향후 최고 수준의 학회 기준을 통과할 수 있는 고품질의 논문 생성을 위해 프로세스를 개선할 계획n사카나 AI는 이번 실험을 계기로 AI가 생성한 과학 연구의 투명성과 윤리성 측면에서 과학 커뮤니티 차원의 규범 개발이 필요하다고 강조∙해당 규범에는 논문이 전적으로나 부분적으로 AI로 생성되었다고 알리는 시점과 방법 등이 포함되어야 하며, 가능한 많은 정보를 공개하여 연구의 투명성 확보가 중요∙사카나 AI는 AI 사이언티스트의 개발 현황에 관하여 연구 커뮤니티와 의견을 지속적으로 교환하여 향후 AI가 동료 심사 통과만을 추구해 학문적 검토 과정의 의미를 훼손하지 않도록 유의할 것이라고 강조출처 | Sakana AI, The AI Scientist Generates its First Peer-Reviewed Scientific Publication, 2025.03.12.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 19, 'page_label': '20'}
SPRi AI Brief2025년 4월호
18
AAAI, 주요 AI 연구 주제와 해결 과제를 정리한 보고서 발간nAAAI가 AI의 빠른 발전 속에 역동적 변화를 겪고 있는 AI 연구의 흐름을 체계적으로 포착하기 위해 주요 AI 연구 주제를 분석한 보고서를 발간n보고서는 △AI 추론 △AI의 사실성과 신뢰성 △AI 에이전트 △AI 평가 △AI 윤리와 안전 △체화 AI를 비롯한 핵심 AI 연구 주제에 대하여 역사와 현재 추세, 해결 과제를 제시
KEY Contents
£AAAI, AI 추론과 AI의 사실성과 신뢰성, AI 에이전트 등 핵심 AI 연구 주제 분석n세계적 권위의 AI 학회 AAAI(The Association for the Advancement of Artificial Intelligence)가 2025년 3월 2일 AI 연구와 관련된 주요 주제의 역사와 추세, 해결 과제를 정리한 보고서를 발간∙AI 기술의 빠른 발전으로 AI 연구 역시 주제와 방법, 연구 커뮤니티, 작업 환경을 포함한 여러 측면에서 역동적 변화를 겪고 있으며, AAAI는 이러한 변화 속에서 AI 연구의 흐름을 체계적인 방식으로 포착하기 위한 목적으로 이번 보고서를 작성n보고서는 △AI 추론 △AI의 사실성과 신뢰성 △AI 에이전트 △AI 평가 △AI 윤리와 안전 △체화 AI와 같은 최근 AI의 핵심 연구 주제에 대하여 다음과 같이 분석∙(AI 추론) 대규모 사전훈련을 거친 LLM은 자동화된 추론 기능에서 상당한 발전을 이루었으나, 추론의 정확성과 깊이를 보장하기 위한 더 많은 연구가 필요∙(AI의 사실성과 신뢰성) AI 시스템의 신뢰성(Trustworthiness) 부족은 중요 애플리케이션에서 AI 시스템 도입을 가로막는 핵심 요인으로, 사실성과 신뢰성 개선을 위해 미세조정, 검색증강 생성(RAG)*과 같은 기술이 사용되고 있으나 근미래에 이러한 문제가 충분히 해결되기는 어려울 전망* LLM의 응답을 생성하기 전 외부의 신뢰할 수 있는 지식 베이스를 참조하는 기술∙(AI 에이전트) AI 구성 요소를 모듈형 시스템으로 구조화해 투명성과 적응성을 개선하는 다중 에이전트 아키텍처 및 AI 에이전트와 인간 간 협력과 공동 의사결정을 강조하는 ‘협력형 AI’가 부상하는 가운데, 다중 에이전트 환경의 확장성과 투명성, 컴퓨팅 효율성을 개선하기 위한 추가 연구가 필요 ∙(AI 평가) 현재의 AI 평가 방식은 AI 모델의 성능을 평가하는 벤치마크 위주의 테스트에 중점을 두고 사용성과 투명성, 윤리 지침 준수와 같은 다른 중요 요소의 평가를 간과하고 있으며, 신뢰성 있는 AI 시스템의 대규모 배포를 위해 AI 시스템 평가를 위한 새로운 통찰력과 방법이 필요∙(AI 윤리와 안전) AI 기반 사이버 범죄와 자율 무기 등의 새로운 위협과 AI 윤리 문제를 해결할 기술·규제적 장치가 부족한 상태로, 학제 간 협업과 지속적 감독, AI 개발에 대한 명확한 책임 할당이 중요∙(체화 AI) 물리적 실체와 실제 환경을 결합하는 체화 AI(Embodied AI)는 주로 로봇에 대하여 시뮬레이션과 현실 환경에서 수많은 시행착오를 통한 강화학습 방식으로 구현되며, 인간 수준의 성능을 지닌 지능형 체화 에이전트를 구축할 수 있는 역량은 아직 확보되지 않았으나 근본적 장애물은 없다는 평가출처 | AAAI, AAAI 2025 Presidential Panel on the Future of AI Research, 2025.03.02.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 20, 'page_label': '21'}
정책・법제기업・산업기술・연구인력・교육
19
2024년 튜링상, 강화학습 연구에 기여한 연구자 2인이 수상nACM이 2024년 튜링상 수상자로 1980년대 부터 강화학습의 주요 개념을 제시하고 수학적 기초를 확립하며 중요 알고리즘을 개발한 바르토 교수와 서튼 교수를 선정nACM은 바르토와 서튼이 수십년 전 개발한 강화학습 알고리즘이 최근 15년간 심층학습 알고리즘과 결합되며 실제 응용 분야에서 큰 진전을 이루었다고 평가
KEY Contents
£ACM, 강화학습의 주요 알고리즘을 개발한 바르토와 서튼 교수에 튜링상 수여n세계 최대의 컴퓨터학회 ACM(Association for Computing Machinery)은 2025년 3월 5일 2024년 튜링상 수상자로 강화학습 분야의 연구에 이바지한 연구자 2인을 선정∙컴퓨터과학의 아버지라 불리는 영국 수학자 앨런 튜링(Allen Turing)의 이름을 딴 튜링상은 컴퓨터과학의 노벨상으로 불리며 구글의 후원으로 100만 달러의 상금을 수여∙ACM은 2024년 튜링상 수상자로 미국 매사추세츠⼤ 애머스트 캠퍼스의 앤드루 바르토(Andrew Barto) 정보·컴퓨터과학과 명예 교수와 캐나다 앨버타⼤의 리처드 서튼(Richard Sutton) 컴퓨터과학과 교수를 선정nACM에 따르면 바르토와 서튼 교수는 1980년대 이래 일련의 논문을 통해 강화학습의 주요 아이디어를 소개하고 수학적 기초를 구축했으며 강화학습의 중요 알고리즘을 개발∙1950년대 앨런 튜링이 보상과 처벌에 기반한 기계학습 접근방식을 제안한 이래 수십 년간 진전이 없던 강화학습 연구에서 바르토와 서튼은 1980년 초 심리학적 관찰을 토대로 강화학습을 문제 해결을 위한 일반적인 프레임워크로 공식화∙두 연구자는 1998년 ‘Reinforcement Learning: An Introduction*’을 공동 저술했으며, 7만 5천 회 이상 인용된 이 교과서는 현재까지도 강화학습 분야의 표준 참고문헌이라는 평가*https://web.stanford.edu/class/psych209/Readings/SuttonBartoIPRLBook2ndEd.pdfnACM은 수십 년 전 개발된 바르토와 서튼의 강화학습 알고리즘이 지난 15년간 심층학습 알고리즘과 통합되며 실제 적용에서 주요 진전이 이루어졌다고 설명∙강화학습의 대표적인 사례는 2016년과 2017년 당대 최고의 바둑 기사를 상대로 승리한 알파고(AlphaGo)가 있으며, 오픈AI의 챗GPT 역시 인간의 피드백을 이용한 강화학습(RLHF) 기술을 적용∙강화학습은 로봇 손 조작과 네트워크 혼잡 제어, 칩 설계, 글로벌 공급망 최적화, 챗봇의 행동 및 추론 개선을 비롯한 다양한 분야에서도 성공적으로 도입n한편, 바르토와 서튼은 현재의 AI 개발 속도를 경계하며 AI 기업들이 제품을 철저히 테스트하지 않고 서둘러 출시하는 경향에 우려를 표시∙바르토 교수는 현재 일부 AI 기업들이 연구를 발전시키는 대신 사업적 이윤의 관점에서 막대한 자금을 투자하고 있다며, 이러한 경향을 비판하고 안전한 엔지니어링 관행의 중요성을 강조출처 | ACM, ACM A.M. Turing Award Honors Two Researchers Who Led the Development of Cornerstone AI Technology, 2025.03.05.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 20, 'page_label': '21'}
Financial Times, Turing Award winners warn over unsafe deployment of AI models, 2025.03.05.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 21, 'page_label': '22'}
SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 22, 'page_label': '23'}
| 2025년 4월호 |
인력・교육
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 23, 'page_label': '24'}
SPRi AI Brief2025년 4월호
22
영국 옥스퍼드⼤ 연구 결과, AI 인력 채용 시 학위보다 실무기술이 중요n영국 옥스퍼드인터넷연구소가 2018~2024년 영국 내 온라인 구인 공고를 분석한 결과, 시간이 흐를수록 AI 일자리에서 학위보다 실무기술을 요구하는 경향이 증가n연구진은 영국 노동시장에서 AI 전문가 채용과 임금 책정 시 학위보다 실무기술과 산업별 노하우가 중요해지고 있다며 정규교육 이외의 다양한 대안을 확대할 것을 권고
KEY Contents
£영국 기업들, 2018~2024년 사이 AI 일자리보다 실무기술을 요구하는 경향 확대n옥스퍼드⼤ 산하 옥스퍼드인터넷연구소(OII)가 2025년 2월 26일 발표한 연구 결과에 따르면 AI 분야의 기업들은 AI 인력 채용 시 정규학위보다 실무기술을 중시∙기존 학술 연구*에 따르면 기업 수요가 노동 공급을 앞서면서 노동력 부족을 겪는 산업에서는 고용주들이 구직자의 학위보다 실제 기술에 주목하는 경향이 확인* Skills-based hiring is on the rise, J Fuller, Harvard Business Review, 2022∙연구진은 AI 중심의 기술 혁명을 오늘날 노동시장을 좌우하는 핵심적인 장기적 추세로 인식하고, AI 분야에서도 고용주들이 형식적인 학위보다 실제 기술 기반의 채용 관행을 적용하는지를 조사n연구진이 2018년 1월부터 2024년 6월 사이 영국 내 약 1,100만 개의 온라인 구인 공고를 분석한 결과, 시간의 흐름에 따라 AI 일자리에서 학위보다 실무기술을 요구하는 경향이 증가∙2018~2023년 사이 하나 이상의 AI 기술을 요구하는 구인 공고는 21% 증가했으며, 특히 2023년 이후 AI 기술 수요가 빠르게 증가하면서 영국 기업들이 사업 전반에 걸쳐 AI 기술을 수용하고 있음을 시사∙AI 일자리에서 학위를 요구하는 구인 공고는 2018년 36%에서 2023년 약 31%로 감소해, 정규교육보다 기술과 경험을 중시하는 방향으로 채용 정책이 전환되었음을 확인 가능n연구진에 따르면 전체 노동시장에서는 고학력 근로자일수록 임금 프리미엄을 받지만, AI 일자리에서는 기술 자체가 임금 프리미엄으로 작용∙연구진의 분석 결과, AI 일자리에서는 공식 학위 요건이 없는 직책도 학사나 박사학위를 보유한 직책과 비슷한 수준의 높은 임금을 받아 정식 교육에 대한 임금 프리미엄이 거의 사라졌음을 시사∙AI 기술은 그 자체로 평균 23%의 임금 프리미엄이 있으며, 이는 박사학위(33%)에 이어 두 번째로 높고 석사학위(13%)를 능가하는 수치로 확인n연구진은 영국 노동시장에서 AI 전문가들은 학위가 아니라 실무기술과 산업별 노하우를 바탕으로 보상을 받는다며, 산업 수요에 따른 유연한 교육 프로그램과 정규교육 이외의 경로로 습득한 기술에 대한 자격 인증의 필요성을 강조∙연구진은 고용주와 영국 정부에 AI 분야의 인력 확보를 위해 견습 제도, 실무 교육, 온라인 공개 강좌(MOOC), 직업 교육과 훈련, 부트캠프 등 정규교육 이외의 다양한 대안을 주류화할 것을 권고출처 | Skills or degree? The rise of skill-based hiring for AI and green jobs, Technological Forecasting and Social Change.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 23, 'page_label': '24'}
2025.02.26
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 24, 'page_label': '25'}
정책・법제기업・산업기술・연구인력・교육
23
스탠포드 HAI, AI+교육 서밋에서 AI가 교육에 미치는 영향 논의n스탠포드 HAI가 개최한 제3회 AI+교육 서밋의 참가자들은 교육 분야에서 윤리적이고 책임 있는 방식으로 AI를 활용하기 위한 논의를 진행n참가자들은 교육 분야의 AI에 대한 신중한 설계와 윤리적 고려를 강조하는 한편, 교육용 AI의 설계와 구현 프로세스에 교사와 학생, 학부모, 정책 입안자의 참여가 필요하다는데 합의
KEY Contents
£서밋 참가자들, 교육용 AI 도구의 신중한 설계와 윤리적 고려 강조n미국 스탠포드 인간중심AI연구소(Stanford HAI)는 AI 연구자, 교육자, 개발자, 정책 입안자들이 모여 AI가 교육과 학습에 미치는 영향을 논의하고자 2025년 2월 25일 제3회 스탠포드 AI+교육 서밋을 개최∙참가자들은 교육과 관련된 AI 연구를 소개하는 한편, 교육 분야에서 윤리적이고 책임 있는 방식으로 AI를 활용하기 위한 논의를 진행n스탠포드⼤ 소속의 연구자들은 AI가 교육에 미치는 영향 및 AI를 활용해 교육 연구를 촉진하는 방법을 논의∙교육학과의 빅터 리(Victor Lee) 교수는 AI 리터러시와 관련해 사용자와 개발자, 비평가의 관점을 모두 포괄하는 공통 언어와 프레임워크의 필요성을 강조∙인간생물학 분야의 마이클 프랭크(Michael Frank) 교수는 헤드 카메라로 수집한 아동의 언어 입력과 처리 데이터를 이용해 AI 모델을 훈련함으로써 아동의 학습 및 발달 방식을 파악하는 연구 프로젝트 ‘베이비뷰(Babyview)’를 소개n교육 관련 비영리단체와 교육자들은 학습을 혁신할 잠재력을 가진 AI에 대한 신중한 설계와 윤리적 고려의 필요성을 강조∙교육 비영리단체 InnovateEDU의 에린 모트(Erin Mote) CEO는 교육 분야의 AI 도입 시 프라이버시의 중요성을 강조하며, 학생 정보와 프라이버시에 대한 보호 책임을 명확히 하고 교육용 AI 도구의 편향을 완화하는 데 집중해야 한다고 발언∙캐서린 트루잇(Catherine Truitt) 전 노스캐롤라이나주 교육감은 AI 사용에 대한 주 차원의 지침이 필요하고 강조하며, 현재까지 교육 분야의 AI 사용 지침을 마련한 주가 26개 주에 불과하다고 언급n참가자들은 서밋 전반에 걸쳐 AI가 인간관계를 보완하되 대체해서는 안 되며, AI 도구의 설계와 접근성 고려 시 형평성을 최우선시해야 한다고 강조∙참가자들은 이를 위해 교사, 학생, 학부모, 정책 입안자가 AI 기술의 설계와 구현 프로세스에 참여해야 한다는 데 대체로 동의∙뉴욕시 공립학교의 디지털 학습 이니셔티브 책임자인 타라 카로자(Tara Carroza)도 미국의 교육 분야가 세계적 경쟁력을 갖추려면 지역사회의 모든 구성원이 AI 도입 과정에 참여해야 한다고 발언출처 | Stanford HAI, AI+Education Summit: The Future is Already Here, 2025.02.27.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 25, 'page_label': '26'}
SPRi AI Brief2025년 4월호
24
영국 정부의 AI 저작권 규제 완화 기조에 창작자들의 반발 격화n영국 정부가 2024년 12월 AI 기업들이 저작권자의 허가 없이 저작물을 사용할 수 있도록 저작권법 변경을 제안하면서 창작 산업계의 반발이 지속n유명 배우와 가수를 포함한 창작 산업계의 반발이 격화되자 영국 정부는 2025년 말 발표 예정인 최종 저작권 정책에서 저작권자를 보호할 수 있는 새로운 방안을 모색
KEY Contents
£영국 창작 산업계, 영국 정부의 AI 저작권 규제 완화 기조에 반발 지속n영국 일간지 가디언(The Guardian)에 따르면 영국 정부가 AI 기업들이 저작권자의 허가 없이 저작물을 사용할 수 있도록 저작권 정책 변경을 추진하면서 창작자들의 반발이 지속∙케이트 부시(Kate Bush), 한스 짐머(Hans Zimmer) 등 음악가 1,000명은 2025년 2월 영국 정부의 저작권 완화 정책에 대한 항의의 표시로 빈 스튜디오나 공연장의 소음을 담은 무음 앨범을 공동 발매∙영화배우 줄리앤 무어(Julianne Moore)를 포함한 4만 명 이상의 예술가들은 “생성 AI 훈련 시 창작물의 허가 없는 사용은 저작권자의 생계에 대한 부당한 위협으로서 허용되어서는 안 된다”는 내용의 성명에 참여n영국 정부는 2024년 12월 ’저작권과 AI에 관한 협의안’을 통해 AI 기업들에 ‘텍스트 및 데이터 마이닝’에 대한 예외를 제공하여 저작물을 이용한 AI 모델 훈련을 허용하는 방안을 제안∙영국 정부는 협의안에서 저작권법을 개정해 창작자가 자신의 작품이 AI 학습에 이용되지 않도록 거부할 수 있는 ‘옵트아웃(Opt-out)*’ 권리를 행사하는 방안을 제시* 기업 등의 데이터의 수집이나 활용에 대하여 정보 소유자가 명시적으로 거부 의사를 표현하는 제도∙그러나 창작자들은 옵트아웃 방식은 해당 옵션의 존재를 모르는 창작자에게 부담을 전가하게 되며, 인터넷상의 콘텐츠 유통을 추적하기 힘들다는 점에서 도입이 어렵다고 지적하며 저작권법의 개정에 반대∙한편, 오픈AI를 비롯한 기술업계는 저작물을 사용하지 않고 AI 모델을 훈련하기는 불가능하다고 인정했으며, 기술업계를 대표하는 산업단체 TechUK는 AI와 저작권법에 대한 현재의 불확실성이 AI의 발전을 저해하고 있다고 주장£영국 정부, 2025년 말 발표할 최종 저작권 정책에서 저작권자 보호할 새로운 방안 모색n가디언에 따르면 유명인을 포함한 창작 산업계의 반발이 이어지면서 영국 정부도 2025년 말 발표 예정인 최종 저작권 정책에서 저작권자를 보호하는 새로운 방안을 모색 중인 것으로 확인∙영국 정부는 영국 AI 기업에는 옵트아웃 방식을, 미국 AI 기업에는 저작물 사용 전 창작자의 동의를 강제하는 방식도 거론∙영국 산업통상부의 조나단 레이놀즈(Jonathan Reynolds) 장관은 창작자들이 적절한 생계를 유지할 수 있어야 하며, 정부가 창작 산업계의 우려에 주목해 AI 산업 발전과 창작자 저작권 보호 간 적절한 균형을 맞춰야 한다고 강조출처 | The Guardian, Why are creatives fighting UK government AI proposals on copyright?, 2025.02.25. The Guardian, UK ministers consider changing AI plans to protect creative industries, 2025.02.25.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 25, 'page_label': '26'}
Gov.uk, Copyright and Artificial Intelligence, 2024.12.17.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 26, 'page_label': '27'}
정책・법제기업・산업기술・연구인력・교육
25
IBM CEO, 가까운 미래에 AI가 프로그래머를 대체할 가능성은 희박하다고 예측nIBM의 아르빈드 크리슈나 CEO는 6개월 안에 코드의 90%가 AI에 의해 작성될 것이라는 앤스로픽 CEO의 주장에 반박하면서, AI가 인간 프로그래머를 대체할 가능성은 희박하다고 예상n크리슈나 CEO는 AI는 궁극적으로 프로그래머의 생산성을 높일 것으로 예상하는 한편, 기존의 지식으로 학습한 AI가 인공 일반지능(AGI)로 발전할 가능성에는 회의를 표시
KEY Contents
£크리슈나 CEO, AI로 작성되는 코드는 전체의 20~30% 수준으로 예상nIT 미디어 테크크런치(TechCrunch)의 2025년 3월 11일 보도에 따르면, 아르빈드 크리슈나(Arvind Krishna) IBM CEO는 AI가 짧은 기간 안에 프로그래머를 대체할 가능성은 희박하다고 예측∙다리오 아모데이(Dario Amodei) 앤스로픽 CEO는 2025년 3월 11일 미국 외교협회의 행사에 참석해 “3~6개월 안에 코드의 90%가 AI에 의해 작성되고, 12개월 이내에는 거의 모든 코드가 AI에 의해 생성될 것”이라고 발언∙크리슈나 CEO는 이러한 예측을 반박하면서, 복잡한 활용 사례를 고려하면 AI가 코드의 약 20~30% 수준만 작성할 수 있을 것으로 예상n크리슈나 CEO는 일부 AI 전문가들의 추측대로 AI가 인간 프로그래머를 대체하는 것이 아니라, 궁극적으로 프로그래머의 생산성을 높일 것으로 전망∙그는 같은 수의 인원으로 30% 더 많은 코드를 작성할 수 있다면 코드 작성이 더욱 늘어날 것이라며, 역사적으로 볼 때 가장 생산적인 기업이 더 많은 제품을 생산해 시장 점유율을 높이게 된다고 강조∙이는 AI 기술로 대체할 수 있는 운영 지원부서에 대한 채용 중단 계획을 밝힌 2023년의 발언과 대조되는 것으로, 현재 IBM은 코딩 보조 도구를 포함한 다양한 AI 기반 제품과 서비스를 판매∙그는 AI가 노동자를 대체할 것이라는 주장은 과거 계산기와 포토샵이 수학자와 예술가를 대체할 것이라는 주장과 다름없다며, AI는 궁극적으로 인간을 돕는 도구라고 설명£크리슈나 CEO, 딥시크 사례와 같은 기술 발전으로 AI의 에너지 사용량 대폭 감소 전망n한편, 크리슈나 CEO는 향후 AI가 딥시크(DeepSeek)가 보여준 것과 같은 기술 발전에 힘입어 현재 사용하는 에너지의 1% 미만을 사용하게 될 것으로 예상∙그는 오픈AI o1 같은 추론 모델은 막대한 컴퓨팅 자원을 사용해 에너지 집약적이나, 딥시크 이후 등장한 기술 발전 사례를 언급하며, 대규모 모델의 필요성에 의문이 제기되고 있다고 설명n그러나 크리슈나 CEO는 기존에 만들어진 지식과 문헌, 이미지 등에서 학습한 AI는 앞으로 일어날 일을 예측하지는 못한다면서, 인공 일반지능(AGI)에 대한 회의를 표시∙이는 향후 몇 년 안에 초지능 AI가 실현되어 혁신을 대폭 앞당길 것이라는 샘 알트먼(Sam Altman) 오픈AI CEO의 주장과 대조되며, 크리슈나 CEO는 양자 컴퓨팅이 과학적 발견을 촉진하는 핵심 기술이 될 것으로 예상출처 | TechCrunch, IBM’s CEO doesn’t think AI will replace programmers anytime soon, 2025.03.11.
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 27, 'page_label': '28'}
26
주요행사일정월기간행사명장소홈페이지1월7~10일(CES 2025) The International Consumer Electronics Show미국, 라스베이거스www.ces.tech2월5~6일AI & Big Data Expo Global 2025영국, 런던www.ai-expo.net/global27~4일(AAAI 2025) Association for the Advancement of Artificial Intelligence Conference미국, 필라델피아aaai.org/conference/aaai/aaai-253월17~21일NVIDIA GTC 2025미국, 산호세(온라인 병행)www.nvidia.com/ko-kr/gtc26~27일Chief Data & Analytics Officers캐나다, 토론토cdao-canada.coriniumintelligence.com4월15~16일World Summit AI Americas캐나다, 몬트리올americas.worldsummit.ai24~26일 월드 IT 쇼 2025서울, 강남www.worlditshow.co.kr29일 LlamaCon 2025미국, 멘로파크www.llama.com/events/llamacon/signup29~30일Generative AI Summit미국, 산타클라라world.aiacceleratorinstitute.com/location/siliconvalley5월5~7일(IEEE CAI 2025) IEEE Conference on Artificial Intelligence미국, 산타클라라cai.ieee.org/20256~8일Microsoft 365 Conference미국, 라스베이거스m365conf.com14일Rise of AI Conference독일, 베를린(온라인 병행)riseof.ai/conference-202519~22일Microsoft Build 2025미국, 시애틀build.microsoft.com/en-US/home20~21일Google I/O 2025미국, 마운틴뷰io.google/20256월4~5일AI & Big Data Expo North America 2025미국, 산타클라라www.ai-expo.net/northamerica9~13일 WWDC25미국, 쿠퍼티노developer.apple.com11~15일(CVPR 2025) The IEEE / CVF Computer Vision and Pattern Recognition Conference 미국, 네슈빌cvpr.thecvf.com11~12일AI SUMMIT LONDON영국, 런던london.theaisummit.com11~13일(STK 2025) 스마트테크 코리아서울, 강남smarttechkorea.com18~19일AI World Congress 2025영국, 런던aiconference.london18~20일(MVEX 2025) 2025 메타버스 엑스포서울, 강남metavexpo.com7월8~11일AI for Good Global Summit 2025스위스, 제네바aiforgood.itu.int13~19일 ICML 2025캐나다, 밴쿠버icml.cc25~27일(AICSIP 2025) 2025 IEEE 7th International Conference on Artificial Intelligence, Computer Science and Information Processing중국, 항저우www.aicsconf.cn27~1일(ACL 2025) the Association for Computational Linguistics오스트리아, 빈2025.aclweb.org8월11~13일(Ai4 2025) the Forefront of AI Innovation미국, 라스베이거스ai4.io/vegas9월9~11일AI Infra Summit 2025미국, 산타클라라www.ai-infra-summit.com17~18일The AI Conference미국, 샌프란시스코aiconference.com17~18일 Meta Connect미국, 멘로파크www.meta.com/connect24~25일AI & Big Data Expo EUROPE 2025네덜란드, 암스테르담www.ai-expo.net/europe10월8~9일 World Summit AI네덜란드, 암스테르담worldsummit.ai11월13~14일AI and Machine Learning Conference 2025싱가포르pubscholars.org/ai-and-machine-learning-conference14~15일2025 ICT 산업전망컨퍼런스서울, 서초ictconference.kr17~21일 Microsoft Ignite미국, 샌프란시스코ignite.microsoft.com12월2~7일 NeurIPS 2025미국, 샌디에이고neurips.cc3~5일(소프트웨이브 2025) 10회 대한민국 소프트웨어 대전서울, 강남www.k-softwave.com10~11일AI Summit New York미국, 뉴욕newyork.theaisummit.com
----------------------------------------------------------------------------------------------------
{'producer': 'Hancom PDF 1.3.0.505', 'creator': 'Hancom PDF 1.3.0.505', 'creationdate': '2025-04-04T07:23:56+09:00', 'author': 'dj', 'moddate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'total_pages': 29, 'page': 28, 'page_label': '29'}
홈페이지 : https://spri.kr보고서와 관련된 문의는 AI정책연구실(hs.lee@spri.kr, 031-739-7333)로 연락주시기 바랍니다.경기도 성남시 분당구 대왕판교로 712번길 22 글로벌 R&D 연구동(B) 4층22, Daewangpangyo-ro 712beon-gil, Bundang-gu, Seongnam-si, Gyeonggi-do, Republic of Korea, 13488
----------------------------------------------------------------------------------------------------
사용자의 질의(Query)를 임베딩 벡터로 변환한 뒤, 벡터 데이터베이스에 저장된 청크(Chunk) 벡터들과의 유사도를 계산하여 가장 관련성 높은 결과를 찾아주는 구성 요소
즉, “검색기” 역할을 하는데, 단순히 키워드 일치를 찾는 것이 아니라 의미적 유사성을 기반으로 정보를 불러온다.
이를 위해 코사인 유사도, 내적(dot product), 유클리드 거리 등의 수학적 방법을 활용하며, 검색된 결과는 LLM과 결합되어 RAG(Retrieval-Augmented Generation) 같은 구조에서 모델의 답변 품질을 높이는 데 쓰인다.
→ “의미를 이해하는 검색 엔진”
!pip install langchain_chroma
!pip install -U langchain langchain-chroma langchain-openai chromadb
!pip install -U "opentelemetry-api==1.26.0" \
"opentelemetry-sdk==1.26.0" \
"opentelemetry-exporter-otlp-proto-grpc==1.26.0"
from langchain_chroma import Chroma
from langchain_openai import OpenAIEmbeddings
vectorstore = Chroma.from_documents(documents=docs, embedding=OpenAIEmbeddings())
# query = "카나나의 테크니컬 리포트는 어떤 내용인가요?"
# query = "에이전트 SDK는 어떤 기능을 제공하나요?"
query = "딥마인드가 발표한 로봇AI 모델은?"
results = vectorstore.similarity_search(query, k=1)
results
print(results[0].page_content)
SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
# 벡터스토어를 검색기로 바꿔줌, 가장 유사한 문서 1개만 찾음
vector_retriever = vectorstore.as_retriever(search_kwargs={"k": 1})
relevant_doc = vector_retriever.invoke(query)
print(relevant_doc)
[Document(id='949e9339-0791-460c-87d6-7361dd71ea3b', metadata={'author': 'dj', 'creationdate': '2025-04-04T07:23:56+09:00', 'pdfversion': '1.4', 'total_pages': 29, 'source': 'SPRi AI Brief_4월호_산업동향_250407_F.pdf', 'creator': 'Hancom PDF 1.3.0.505', 'page': 17, 'page_label': '18', 'producer': 'Hancom PDF 1.3.0.505', 'moddate': '2025-04-04T07:23:56+09:00'}, page_content='SPRi AI Brief2025년 4월호\n16\n구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개\nKEY Contents\n£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.')]
print(relevant_doc[0].page_content)
SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
하나의 검색 방식에만 의존하지 않고, 여러 종류의 리트리버를 조합해 더 정확하고 풍부한 검색 결과를 제공하는 방법
ex) 키워드 기반의 전통적 BM25 리트리버와 의미 기반의 벡터 리트리버를 함께 사용하면, 단어가 정확히 일치하는 문서뿐 아니라 의미적으로 관련 있는 문서도 함께 찾아낼 수 있다.
이렇게 서로 다른 리트리버의 강점을 결합하면 검색 누락을 줄이고, 다양한 관점에서 문서를 확보할 수 있어 RAG(Retrieval-Augmented Generation) 구조에서 더욱 신뢰도 높은 응답을 생성하는 데 유용하다.
전통적인 정보 검색 기법 중 하나로, 사용자의 질의(Query)와 문서 간의 키워드 일치 정도를 계산해 관련성이 높은 문서를 찾아주는 방식이다.
기본적으로 단어 빈도(Term Frequency), 역문서 빈도(Inverse Document Frequency), 그리고 문서 길이를 고려해 점수를 매기며, 특정 단어가 질의에 많이 등장하거나 드문 단어일수록 가중치를 높게 주어 검색 정확도를 높인다.
벡터 리트리버처럼 의미적 유사성을 직접 파악하지는 못하지만, 빠르고 해석 가능한 결과를 제공하기 때문에 대규모 문서 검색이나 키워드 중심 검색에서 여전히 많이 활용되며, 종종 벡터 리트리버와 결합해 앙상블 리트리버로 사용된다.
!pip install rank_bm25
from langchain.retrievers import BM25Retriever, EnsembleRetriever
bm25_retriever = BM25Retriever.from_documents(
docs,
)
bm25_retriever.k = 1
ensemble_retriever = EnsembleRetriever(
# BM25에 더 높은 비중(70%)을 주고, 임베딩 검색은 보조(30%)로 섞음
retrievers=[bm25_retriever, vector_retriever],
weights=[0.7, 0.3],
)
# query = "깊이 업스케일링 (Depth UP-Scaling)"
# query = "카나나의 테크니컬 리포트는 어떤 내용인가요?"
# query = "에이전트 SDK는 어떤 기능을 제공하나요?"
query = "에이전트 SDK"
ensemble_result = ensemble_retriever.invoke(query)
bm25_result = bm25_retriever.invoke(query)
vector_result = vector_retriever.invoke(query)
print("[Ensemble Retriever]")
for doc in ensemble_result:
print(f"Content: {doc.page_content}")
print()
[Ensemble Retriever]
Content: SPRi AI Brief2025년 4월호
8
오픈AI, AI 에이전트 구축 지원 도구와 신규 음성·이미지 생성 모델 출시n오픈AI가 AI 에이전트의 효율적 구축을 지원하는‘Response API’와 다중 에이전트 기반의 업무 프로세스 조율을 지원하는 ‘에이전트 SDK’를 출시n오픈AI는 개발자 대상으로 API에서 음성인식 및 음성합성 모델 3종을 공개하는 한편, GPT-4o를 기반으로 텍스트와 이미지 생성을 통합한 AI 모델도 공개
KEY Contents
£오픈AI의 Response API, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 지원 n오픈AI가 2025년 3월 11일 개발자의 효율적인 AI 에이전트 구축을 지원하는 ‘Response API’를 공개∙Response API는 여러 API나 외부 공급업체를 사용하지 않고 오픈AI의 모델과 기본 제공 도구를 앱에 쉽게 결합하려는 개발자를 위한 API로, 웹 검색, 파일 탐색, 컴퓨터 사용(Computer Use)*등 기능을 지원* 브라우저 기반의 실제 작업(예: 파일 다운로드, 웹 검색 등)을 수행할 수 있는 오픈AI의 에이전트 기능∙오픈AI는 대화형 응답을 생성하는 ‘Chat Completions API’ 및 AI 어시스턴트 생성과 관리를 지원하는 ‘Assistants API’의 기능을 결합해 Response API를 출시했으며, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 통해 AI 모델이 현실의 복잡한 작업을 수행할 수 있다고 설명n오픈AI는 Response API와 함께 개발자가 다중 에이전트 기반의 업무 프로세스 조율을 간소화할 수 있도록 지원하는 ‘에이전트 SDK*’도 공개* Software Development Kit: 특정 플랫폼이나 API를 쉽게 사용할 수 있도록 제공하는 도구 모음∙오픈AI는 2024년 10월 공개한 실험적 SDK ‘Swarm’을 바탕으로 LLM의 손쉬운 구성, 에이전트 간 지능적 연계 지원, 안전 가드레일 적용 등의 개선 사항을 적용해 에이전트 SDK를 출시£오픈AI, 신규 음성인식·음성합성과 이미지 생성 모델 출시 n오픈AI는 2025년 3월 20일 API로 음성인식(Speech-to-Text) 모델 ‘gpt-4o-transcribe’ 및 ‘gpt-4o-mini-trasncribe’와 음성합성(Text-to-Speech) 모델 ‘gpt-4o-mini-tts’를 출시∙이 모델들은 악센트, 소음이 있는 환경과 같은 까다로운 조건에서도 높은 정확도를 유지하는 것이 특징으로, 특히 음성인식 모델은 기존 ‘위스퍼(Whisper)’ 모델 대비 단어 오류율(WER)이 크게 개선 n오픈AI는 2025년 3월 25일 텍스트와 이미지 생성 기능을 통합해 더욱 정확하고 사실적인 이미지를 생성하는 ‘GPT-4o 이미지 생성(Image Generation)’ 모델도 출시∙오픈AI에 따르면 GPT-4o에서 이미지 생성 기능이 기본으로 제공되므로 GPT-4o의 지식 베이스와 대화 맥락을 활용해 사용자 요구를 세밀하게 반영한 이미지를 생성하며 이미지에 삽입되는 텍스트 품질도 크게 개선∙GPT-4o 이미지 생성 모델은 챗GPT의 기본 이미지 생성기로 유료 사용자뿐 아니라 무료 사용자에게도 제공되며, 개발자를 위한 API 접근도 몇 주 안에 지원될 예정출처 | OpenAI, New tools for building agents, 2025.03.11.OpenAI, Introducing 4o Image Generation, 2025.03.25.OpenAI, Introducing next-generation audio models in the API, 2025.03.20.
print("[BM25 Retriever]")
for doc in bm25_result:
print(f"Content: {doc.page_content}")
print()
[BM25 Retriever]
Content: SPRi AI Brief2025년 4월호
8
오픈AI, AI 에이전트 구축 지원 도구와 신규 음성·이미지 생성 모델 출시n오픈AI가 AI 에이전트의 효율적 구축을 지원하는‘Response API’와 다중 에이전트 기반의 업무 프로세스 조율을 지원하는 ‘에이전트 SDK’를 출시n오픈AI는 개발자 대상으로 API에서 음성인식 및 음성합성 모델 3종을 공개하는 한편, GPT-4o를 기반으로 텍스트와 이미지 생성을 통합한 AI 모델도 공개
KEY Contents
£오픈AI의 Response API, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 지원 n오픈AI가 2025년 3월 11일 개발자의 효율적인 AI 에이전트 구축을 지원하는 ‘Response API’를 공개∙Response API는 여러 API나 외부 공급업체를 사용하지 않고 오픈AI의 모델과 기본 제공 도구를 앱에 쉽게 결합하려는 개발자를 위한 API로, 웹 검색, 파일 탐색, 컴퓨터 사용(Computer Use)*등 기능을 지원* 브라우저 기반의 실제 작업(예: 파일 다운로드, 웹 검색 등)을 수행할 수 있는 오픈AI의 에이전트 기능∙오픈AI는 대화형 응답을 생성하는 ‘Chat Completions API’ 및 AI 어시스턴트 생성과 관리를 지원하는 ‘Assistants API’의 기능을 결합해 Response API를 출시했으며, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 통해 AI 모델이 현실의 복잡한 작업을 수행할 수 있다고 설명n오픈AI는 Response API와 함께 개발자가 다중 에이전트 기반의 업무 프로세스 조율을 간소화할 수 있도록 지원하는 ‘에이전트 SDK*’도 공개* Software Development Kit: 특정 플랫폼이나 API를 쉽게 사용할 수 있도록 제공하는 도구 모음∙오픈AI는 2024년 10월 공개한 실험적 SDK ‘Swarm’을 바탕으로 LLM의 손쉬운 구성, 에이전트 간 지능적 연계 지원, 안전 가드레일 적용 등의 개선 사항을 적용해 에이전트 SDK를 출시£오픈AI, 신규 음성인식·음성합성과 이미지 생성 모델 출시 n오픈AI는 2025년 3월 20일 API로 음성인식(Speech-to-Text) 모델 ‘gpt-4o-transcribe’ 및 ‘gpt-4o-mini-trasncribe’와 음성합성(Text-to-Speech) 모델 ‘gpt-4o-mini-tts’를 출시∙이 모델들은 악센트, 소음이 있는 환경과 같은 까다로운 조건에서도 높은 정확도를 유지하는 것이 특징으로, 특히 음성인식 모델은 기존 ‘위스퍼(Whisper)’ 모델 대비 단어 오류율(WER)이 크게 개선 n오픈AI는 2025년 3월 25일 텍스트와 이미지 생성 기능을 통합해 더욱 정확하고 사실적인 이미지를 생성하는 ‘GPT-4o 이미지 생성(Image Generation)’ 모델도 출시∙오픈AI에 따르면 GPT-4o에서 이미지 생성 기능이 기본으로 제공되므로 GPT-4o의 지식 베이스와 대화 맥락을 활용해 사용자 요구를 세밀하게 반영한 이미지를 생성하며 이미지에 삽입되는 텍스트 품질도 크게 개선∙GPT-4o 이미지 생성 모델은 챗GPT의 기본 이미지 생성기로 유료 사용자뿐 아니라 무료 사용자에게도 제공되며, 개발자를 위한 API 접근도 몇 주 안에 지원될 예정출처 | OpenAI, New tools for building agents, 2025.03.11.OpenAI, Introducing 4o Image Generation, 2025.03.25.OpenAI, Introducing next-generation audio models in the API, 2025.03.20.
print("[Vector Retriever]")
for doc in vector_result:
print(f"Content: {doc.page_content}")
print()
[Vector Retriever]
Content: SPRi AI Brief2025년 4월호
8
오픈AI, AI 에이전트 구축 지원 도구와 신규 음성·이미지 생성 모델 출시n오픈AI가 AI 에이전트의 효율적 구축을 지원하는‘Response API’와 다중 에이전트 기반의 업무 프로세스 조율을 지원하는 ‘에이전트 SDK’를 출시n오픈AI는 개발자 대상으로 API에서 음성인식 및 음성합성 모델 3종을 공개하는 한편, GPT-4o를 기반으로 텍스트와 이미지 생성을 통합한 AI 모델도 공개
KEY Contents
£오픈AI의 Response API, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 지원 n오픈AI가 2025년 3월 11일 개발자의 효율적인 AI 에이전트 구축을 지원하는 ‘Response API’를 공개∙Response API는 여러 API나 외부 공급업체를 사용하지 않고 오픈AI의 모델과 기본 제공 도구를 앱에 쉽게 결합하려는 개발자를 위한 API로, 웹 검색, 파일 탐색, 컴퓨터 사용(Computer Use)*등 기능을 지원* 브라우저 기반의 실제 작업(예: 파일 다운로드, 웹 검색 등)을 수행할 수 있는 오픈AI의 에이전트 기능∙오픈AI는 대화형 응답을 생성하는 ‘Chat Completions API’ 및 AI 어시스턴트 생성과 관리를 지원하는 ‘Assistants API’의 기능을 결합해 Response API를 출시했으며, 웹 검색과 파일 검색, 컴퓨터 사용 기능을 통해 AI 모델이 현실의 복잡한 작업을 수행할 수 있다고 설명n오픈AI는 Response API와 함께 개발자가 다중 에이전트 기반의 업무 프로세스 조율을 간소화할 수 있도록 지원하는 ‘에이전트 SDK*’도 공개* Software Development Kit: 특정 플랫폼이나 API를 쉽게 사용할 수 있도록 제공하는 도구 모음∙오픈AI는 2024년 10월 공개한 실험적 SDK ‘Swarm’을 바탕으로 LLM의 손쉬운 구성, 에이전트 간 지능적 연계 지원, 안전 가드레일 적용 등의 개선 사항을 적용해 에이전트 SDK를 출시£오픈AI, 신규 음성인식·음성합성과 이미지 생성 모델 출시 n오픈AI는 2025년 3월 20일 API로 음성인식(Speech-to-Text) 모델 ‘gpt-4o-transcribe’ 및 ‘gpt-4o-mini-trasncribe’와 음성합성(Text-to-Speech) 모델 ‘gpt-4o-mini-tts’를 출시∙이 모델들은 악센트, 소음이 있는 환경과 같은 까다로운 조건에서도 높은 정확도를 유지하는 것이 특징으로, 특히 음성인식 모델은 기존 ‘위스퍼(Whisper)’ 모델 대비 단어 오류율(WER)이 크게 개선 n오픈AI는 2025년 3월 25일 텍스트와 이미지 생성 기능을 통합해 더욱 정확하고 사실적인 이미지를 생성하는 ‘GPT-4o 이미지 생성(Image Generation)’ 모델도 출시∙오픈AI에 따르면 GPT-4o에서 이미지 생성 기능이 기본으로 제공되므로 GPT-4o의 지식 베이스와 대화 맥락을 활용해 사용자 요구를 세밀하게 반영한 이미지를 생성하며 이미지에 삽입되는 텍스트 품질도 크게 개선∙GPT-4o 이미지 생성 모델은 챗GPT의 기본 이미지 생성기로 유료 사용자뿐 아니라 무료 사용자에게도 제공되며, 개발자를 위한 API 접근도 몇 주 안에 지원될 예정출처 | OpenAI, New tools for building agents, 2025.03.11.OpenAI, Introducing 4o Image Generation, 2025.03.25.OpenAI, Introducing next-generation audio models in the API, 2025.03.20.
!pip install langgraph
from langgraph.graph import StateGraph, MessagesState
class State(MessagesState):
context: str
graph_builder = StateGraph(State)
from langchain_core.messages import HumanMessage
def retriever(state: State):
"""
Retrieve the relevant document and return the content.
"""
print("##### RETRIEVER #####")
query = state["messages"][0].content
ensemble_result = ensemble_retriever.invoke(query)
content = ensemble_result[0].page_content
print("[CONTEXT]\n", content)
return {"context" : content, "messages": [HumanMessage(content=content)]}
랭체인 허브(LangChain Hub)
개발자와 연구자들이 프롬프트(Prompt), 체인(Chain), 에이전트(Agent) 같은 LLM 관련 리소스를 공유하고 재사용할 수 있도록 만든 오픈 플랫폼
사용자는 자신이 만든 프롬프트 템플릿을 업로드해 다른 사람과 공유할 수 있고, 다른 사람이 만든 검증된 프롬프트를 hub.pull() 같은 방식으로 손쉽게 불러와 활용할 수 있다.
매번 새롭게 프롬프트를 설계할 필요 없이 빠르게 실험하고 협업할 수 있으며, 다양한 검색 기능을 제공해 특정 목적(Q&A, 요약, RAG 등)에 맞는 템플릿을 쉽게 찾을 수 있다.
→ 랭체인 허브는 LLM 애플리케이션 개발을 가속화하는 중앙 저장소 역할을 한다.
from langchain_core.prompts import ChatPromptTemplate
from langchain_openai import ChatOpenAI
from langchain import hub
llm = ChatOpenAI(model="gpt-5-nano", temperature=0) # temperature=0 이성적인. 창의성 최소화. 일관적인 답변.
def answer(state: State):
"""
Answer the question based on the retrieved document.
"""
print("##### ANSWER #####")
query = state["messages"][0].content
context = state["messages"][-1].content
# context = state["context"]
# prompt = ChatPromptTemplate.from_messages(
# [
# ("system",
# """
# You are an assistant for answering questions based on retrieved document context.
# Answer in Korean.
# Context: {context}"""
# ),
# ("human", "{question}"),
# ]
# )
prompt = hub.pull("rlm/rag-prompt")
# You are an assistant for question-answering tasks. Use the following pieces of retrieved context to answer the question. If you don't know the answer, just say that you don't know. Use three sentences maximum and keep the answer concise.
# Question: {question}
# Context: {context}
# Answer:
response = llm.invoke(
prompt.format_messages(context=context, question=query)
)
return {"messages": [response]}
hub.pull("rlm/rag-prompt").pretty_print()
================================ Human Message =================================
You are an assistant for question-answering tasks. Use the following pieces of retrieved context to answer the question. If you don't know the answer, just say that you don't know. Use three sentences maximum and keep the answer concise.
Question: {question}
Context: {context}
Answer:
from langgraph.graph import START, END
graph_builder.add_sequence([retriever, answer])
graph_builder.add_edge(START, "retriever")
graph_builder.add_edge("answer", END)
graph = graph_builder.compile()
graph

response = graph.invoke({"messages": "카나나의 테크니컬 리포트는 어떤 내용인가요?"})
for mes in response['messages']:
mes.pretty_print()
##### RETRIEVER #####
[CONTEXT]
SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
##### ANSWER #####
================================ Human Message =================================
카나나의 테크니컬 리포트는 어떤 내용인가요?
================================ Human Message =================================
SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
================================== Ai Message ==================================
카나나의 테크니컬 리포트는 카나나의 구조와 학습 과정, 성능을 상세히 다루고 있으며 단계별 사전학습, 가지치기, 지식증류 등의 학습 기법으로 학습 효율성을 극대화했다고 설명합니다.
리포트에 따르면 8B와 26.8B 모델에서 시작해 가지치기와 증류를 거쳐 카나나 나노 2.1B를 구축했고, 깊이 업스케일링으로 에센스 9.8B와 플래그 32.5B를 개발했습니다.
또한 연구 목적의 활용을 위해 카나나 나노 2.1B의 base/instruct 버전과 문서 임베딩용 버전을 오픈소스로 공개했고, 온디바이스에서 작동하도록 경량화되었다고 밝혔습니다.
from langchain.tools.retriever import create_retriever_tool
# 검색기, Tool 이름, Tool 설명(언제 이 툴을 써야 할지 설명)
retriever_tool = create_retriever_tool(
ensemble_retriever,
"retrieve_AI_brief",
"Search and return information about AI Technology and Industry.",
)
tools = [retriever_tool]
from langgraph.graph import StateGraph, MessagesState
graph_builder = StateGraph(MessagesState)
from langgraph.prebuilt import ToolNode, tools_condition
tool_node = ToolNode(tools=tools)
graph_builder.add_node("retriever", tool_node)
<langgraph.graph.state.StateGraph at 0x7b59ab75ce90>
llm_with_tools = llm.bind_tools(tools)
def chatbot(state: State):
return {"messages": [llm_with_tools.invoke(state["messages"])]} # 1) 도구 호출(tool_calls) 2) AI Message
graph_builder.add_node("chatbot", chatbot)
<langgraph.graph.state.StateGraph at 0x7b59ab75ce90>
graph_builder.add_conditional_edges(
"chatbot",
tools_condition,
{
"tools" : "retriever",
END: END
}
)
graph_builder.add_node("answer", answer)
graph_builder.add_edge(START, "chatbot")
graph_builder.add_edge("retriever", "answer")
graph_builder.add_edge("answer", END)
graph = graph_builder.compile()
graph

response = graph.invoke({"messages": "카나나의 테크니컬 리포트는 어떤 내용인가요?"})
for mes in response['messages']:
mes.pretty_print()
##### ANSWER #####
================================ Human Message =================================
카나나의 테크니컬 리포트는 어떤 내용인가요?
================================== Ai Message ==================================
Tool Calls:
retrieve_AI_brief (call_AAwDNJGcnj15sqnQN7UdkrjO)
Call ID: call_AAwDNJGcnj15sqnQN7UdkrjO
Args:
query: 카나나 기술 보고서
================================= Tool Message =================================
Name: retrieve_AI_brief
SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
================================== Ai Message ==================================
카카오는 자체 개발 LLM 카나나의 구조와 학습 과정을 상세히 다룬 테크니컬 리포트를 공개했고, 단계별 사전학습, 가지치기, 지식 증류 등 학습 기법으로 학습 효율성을 극대화했다고 설명합니다.
카나나의 라인업은 플래그(32.5B), 에센스(9.8B), 나노(2.1B)로 구성되며, 8B·26.8B 모델에서의 학습과 깊이 업스케일링으로 이들 모델을 파생했고 한국어 벤치마크 KMMLU에서 경쟁 모델을 앞섰다고 밝힙니다.
연구 목적의 활용을 위해 카나나 나노 2.1B의 base/instruct/embedding 버전을 오픈소스로 공개했고, 온디바이스에서도 구동되도록 설계되었으나 고난도 태스크에선 한계가 있다고 요약합니다.

import getpass
import os
def _set_env(var: str):
if not os.environ.get(var):
os.environ[var] = getpass.getpass(f"{var}: ")
_set_env("OPENAI_API_KEY")
_set_env("TAVILY_API_KEY")
!pip install langchain_community langchain_experimental langchain_openai pypdf
from langchain_community.document_loaders import PyPDFLoader
from langchain_experimental.text_splitter import SemanticChunker
from langchain_openai.embeddings import OpenAIEmbeddings
file_path = "/content/SPRi AI Brief_4월호_산업동향_250407_F.pdf"
loader = PyPDFLoader(file_path)
pages = []
async for page in loader.alazy_load():
pages.append(page)
text_splitter = SemanticChunker(OpenAIEmbeddings())
docs = text_splitter.split_documents(pages)
!pip install langchain_chroma
!pip install -U "opentelemetry-api==1.26.0" \
"opentelemetry-sdk==1.26.0" \
"opentelemetry-exporter-otlp-proto-grpc==1.26.0"
from langchain_chroma import Chroma
from langchain_openai import OpenAIEmbeddings
vectorstore = Chroma.from_documents(documents=docs, embedding=OpenAIEmbeddings())
retriever = vectorstore.as_retriever(search_kwargs={"k": 1})
!pip install langgraph
from langgraph.graph import MessagesState
class State(MessagesState):
"""
Represents the state of our graph.
Attributes:
question: question
generation: LLM generation
document: retrieved document
"""
question: str
generation: str
document: str
from langchain.tools.retriever import create_retriever_tool
retriever_tool = create_retriever_tool(
retriever,
"retrieve_ai_policy_april_2025",
"Search and return information from the April 2025 AI Policy Report, including global AI policies, legal regulations, major industry updates, technical research, education trends, and government strategies related to AI development.",
)
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(model="gpt-4o-mini", temperature=0)
def agent(state: State):
"""
Invokes the agent model to generate a response based on the current state. Given
the question, it will decide to retrieve using the retriever tool, or simply end.
"""
print("##### HI ! #####")
messages = state["messages"]
llm_with_tools = llm.bind_tools([retriever_tool]) # , tool_choice="any"
response = llm_with_tools.invoke(messages)
print("response", response)
return {"messages": [response], "question" : messages[0].content}
def retrieve(state: State):
"""
Retrieve documents
"""
print("##### RETRIEVE #####")
question = state["question"]
document = retriever.invoke(question)
return {"document": document[0].page_content, "question": question}
from pydantic import BaseModel, Field
class Grade(BaseModel):
"""Binary score for relevance check."""
binary_score: str = Field(description="Relevance score 'yes' or 'no'")
from langchain import hub
from langchain_core.prompts import ChatPromptTemplate
def grade_documents(state: State):
"""
Determines whether the retrieved document is relevant to the question.
"""
print("##### CHECK RELEVANCE #####")
grader = llm.with_structured_output(Grade)
grader_prompt = ChatPromptTemplate.from_template(
"""
You are a grader assessing relevance of a retrieved document to a user question. \n
Here is the retrieved document: \n\n {context} \n\n
Here is the user question: {question} \n
If the document contains keyword(s) or semantic meaning related to the user question, grade it as relevant. \n
It does not need to be a stringent test. The goal is to filter out erroneous retrievals. \n
Give a binary score 'yes' or 'no' score to indicate whether the document is relevant to the question.
"""
)
chain = grader_prompt | grader
question = state["question"]
print("state[messages]", state["messages"])
document = state["document"]
print("question", question)
print("context", document)
score = chain.invoke({"question": question, "context": document})
print("context", document)
grade = score.binary_score
print("grade", grade)
if grade == "yes":
print("---GRADE: DOCUMENT RELEVANT---")
return {"document": document, "question": question}
else:
print("---GRADE: DOCUMENT NOT RELEVANT---")
return {"document": "", "question": question}
def generate(state: State):
"""
Generate answer based on the retrieved document and the question.
"""
print("##### GENERATE #####")
question = state["question"]
document = state["document"]
print("question", question)
print("context", document)
prompt = hub.pull("rlm/rag-prompt")
response = llm.invoke(
prompt.format_messages(context=document, question=question)
)
print("response", response)
return {"documents": document, "question": question, "generation": response.content, "messages": [response]}
hub.pull("rlm/rag-prompt")
ChatPromptTemplate(input_variables=['context', 'question'], input_types={}, partial_variables={}, metadata={'lc_hub_owner': 'rlm', 'lc_hub_repo': 'rag-prompt', 'lc_hub_commit_hash': '50442af133e61576e74536c6556cefe1fac147cad032f4377b60c436e6cdcb6e'}, messages=[HumanMessagePromptTemplate(prompt=PromptTemplate(input_variables=['context', 'question'], input_types={}, partial_variables={}, template="You are an assistant for question-answering tasks. Use the following pieces of retrieved context to answer the question. If you don't know the answer, just say that you don't know. Use three sentences maximum and keep the answer concise.\nQuestion: {question} \nContext: {context} \nAnswer:"), additional_kwargs={})])
from langchain_core.messages import HumanMessage
def transform_query(state):
"""
Transform the query to produce a better question.
Args:
state (dict): The current graph state
Returns:
state (dict): Updates question key with a re-phrased question
"""
print("##### TRANSFORM QUERY #####")
question = state["question"]
system = """You a question re-writer that converts an input question to a better version that is optimized \n
for vectorstore retrieval. Look at the input and try to reason about the underlying semantic intent / meaning."""
re_write_prompt = ChatPromptTemplate.from_messages(
[
("system", system),
(
"user",
"Here is the initial question: \n\n {question} \n Formulate an improved question In Korean. ",
),
]
)
question_rewriter = re_write_prompt | llm
better_question = question_rewriter.invoke({"question": question})
print("question", question)
print("better_question", better_question.content)
return {"question": better_question.content, "messages": [better_question]}
from langchain_community.tools.tavily_search import TavilySearchResults
from langgraph.prebuilt import create_react_agent
from langchain_openai import ChatOpenAI
llm = ChatOpenAI(model="gpt-4o-mini", temperature=0)
web_search_agent = create_react_agent(llm, tools=[TavilySearchResults(max_results=3)])
def decide_to_generate(state):
"""
Determines whether to generate an answer, or re-generate a question.
"""
print("##### ASSESS GRADED DOCUMENTS #####")
if state["document"] == "":
print(
"---DECISION: RETRIEVED DOCUMENT ARE NOT RELEVANT TO QUESTION, TRANSFORM QUERY---"
)
return "transform_query"
else:
print("---DECISION: GENERATE---")
return "generate"
답변 해결성 평가 (답변과 질문을 비교)
class GradeAnswer(BaseModel):
"""Binary score to assess answer addresses question."""
binary_score: str = Field(
description="Answer addresses the question, 'yes' or 'no'"
)
structured_llm_grader = llm.with_structured_output(GradeAnswer)
system = """You are a grader assessing whether an answer addresses / resolves a question \n
If ambiguous, return no. \n
Give a binary score 'yes' or 'no'. Yes' means that the answer resolves the question."""
answer_prompt = ChatPromptTemplate.from_messages(
[
("system", system),
("user", "User question: \n\n {question} \n\n LLM generation: {generation}"),
]
)
answer_grader = answer_prompt | structured_llm_grader
# 환각 평가 (문서와 답변을 비교하여 팩트 체크)
class GradeHallucinations(BaseModel):
"""Binary score for hallucination present in generation answer."""
binary_score: str = Field(
description="Answer is grounded in the facts, 'yes' or 'no'"
)
structured_llm_grader = llm.with_structured_output(GradeHallucinations)
system = """You are a grader assessing whether an LLM generation is grounded in / supported by a set of retrieved facts. \n
Give a binary score 'yes' or 'no'. 'Yes' means that the answer is grounded in / supported by the set of facts."""
hallucination_prompt = ChatPromptTemplate.from_messages(
[
("system", system),
("user", "Set of facts: \n\n {document} \n\n LLM generation: {generation}"),
]
)
hallucination_grader = hallucination_prompt | structured_llm_grader
def grade_generation_v_documents_and_question(state):
"""
Determines whether the generation is grounded in the document and answers question.
"""
print("##### CHECK HALLUCINATIONS #####")
question = state["question"]
document = state["document"]
generation = state["generation"]
score = hallucination_grader.invoke(
{"document": document, "generation": generation}
)
grade = score.binary_score
if grade == "yes": # 환각 없음
print("---DECISION: GENERATION IS GROUNDED IN DOCUMENTS---")
score = answer_grader.invoke({"question": question, "generation": generation})
grade = score.binary_score
if grade == "yes": # 답변이 질문을 해결함
print("---DECISION: GENERATION ADDRESSES QUESTION---")
return "useful"
else: # 답변이 질문을 해결하지 않음
print("---DECISION: GENERATION DOES NOT ADDRESS QUESTION---")
return "not useful"
else: # 환각 있음
print("---DECISION: GENERATION IS NOT GROUNDED IN DOCUMENTS, RE-TRY---")
return "not supported"
from langgraph.graph import END, StateGraph, START
from langgraph.prebuilt import ToolNode, tools_condition
graph_builder = StateGraph(State)
graph_builder.add_node("agent", agent)
graph_builder.add_node("web_search_agent", web_search_agent)
graph_builder.add_node("retrieve", retrieve)
graph_builder.add_conditional_edges(
"agent",
tools_condition,
{
"tools": "retrieve",
END: "web_search_agent",
},
)
graph_builder.add_edge(START, "agent")
graph_builder.add_edge("web_search_agent", END)
graph_builder.add_node("grade_documents", grade_documents)
graph_builder.add_node("generate", generate)
graph_builder.add_node("transform_query", transform_query)
graph_builder.add_edge("retrieve", "grade_documents")
graph_builder.add_conditional_edges(
"grade_documents",
decide_to_generate,
{
"transform_query": "transform_query",
"generate": "generate",
},
)
graph_builder.add_edge("transform_query", "retrieve")
graph_builder.add_conditional_edges(
"generate",
grade_generation_v_documents_and_question,
{
"not supported": "generate",
"useful": END,
"not useful": "transform_query",
},
)
graph = graph_builder.compile()
from IPython.display import Image, display
try:
display(Image(graph.get_graph().draw_mermaid_png()))
except Exception:
pass

try:
display(Image(graph.get_graph(xray=True).draw_mermaid_png()))
except Exception:
pass

# case 1: 내부 문서 검색이 필요하지 않은 경우
from langgraph.errors import GraphRecursionError
inputs = {
"messages": "2024년 노벨문학상 수상자는 누구인가요?"
}
try:
response = graph.invoke(inputs)
except GraphRecursionError as e:
print("Recursion Error")
for msg in response["messages"]:
msg.pretty_print()
##### HI ! #####
response content='2024년 노벨문학상 수상자는 아직 발표되지 않았습니다. 노벨문학상은 매년 10월에 발표되며, 2024년 수상자는 그 시점에 공개될 것입니다. 최신 정보를 확인하려면 노벨상 공식 웹사이트나 관련 뉴스를 참고하시기 바랍니다.' additional_kwargs={'refusal': None} response_metadata={'token_usage': {'completion_tokens': 69, 'prompt_tokens': 107, 'total_tokens': 176, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxWqPArpA64zQj4T4WmAqeYMZHAK', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None} id='run--5e6e1200-9789-47ae-b68b-58319d89012a-0' usage_metadata={'input_tokens': 107, 'output_tokens': 69, 'total_tokens': 176, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
================================ Human Message =================================
2024년 노벨문학상 수상자는 누구인가요?
================================== Ai Message ==================================
2024년 노벨문학상 수상자는 아직 발표되지 않았습니다. 노벨문학상은 매년 10월에 발표되며, 2024년 수상자는 그 시점에 공개될 것입니다. 최신 정보를 확인하려면 노벨상 공식 웹사이트나 관련 뉴스를 참고하시기 바랍니다.
================================== Ai Message ==================================
Tool Calls:
tavily_search_results_json (call_pb5MyClCrQHP60WTrXQhgMMF)
Call ID: call_pb5MyClCrQHP60WTrXQhgMMF
Args:
query: 2024 Nobel Prize in Literature winner
================================= Tool Message =================================
Name: tavily_search_results_json
[{"title": "2024 Nobel Prize in Literature - Wikipedia", "url": "https://en.wikipedia.org/wiki/2024_Nobel_Prize_in_Literature", "content": "The 2024 Nobel Prize in Literature was awarded to the South Korean author Han Kang (born 1970) \"for her intense poetic prose that confronts historical traumas and exposes the fragility of human life\". It was announced by the Swedish Academy in Stockholm, Sweden, on 10 October 2024 and was awarded on 10 December 2024.(\n\nShe is the first South Korean and first Asian woman to win the Nobel Prize in literature, making her the 18th woman to win the Nobel Prize in that category.(\n\nLaureate\n\n[edit] [...] 1. ^\"Prize announcement dates\". nobelprize.org.\n2. ^Msh, Adib (10 October 2024). \"Full Details of Nobel Prize Winners 2024\". _The Prime Headline_. Retrieved 10 November 2024.\n3. ^Annabel Rackham (10 October 2024). \"South Korea's Han Kang wins Nobel Literature Prize\". _BBC_. Retrieved 10 October 2024.\n4. ^\"Han Kang wins the Nobel prize in literature for 2024\". _The Economist_. 10 October 2024. Retrieved 10 October 2024. [...] 5. ^ _a__b_Justyna Pawlak and Simon Johnson (10 October 2024). \"Han Kang of South Korea wins Nobel literature prize 2024\". _Reuters_. Retrieved 10 October 2024.\n6. ^\"Nobel Prize in Literature 2024 – Prize announcement\". _nobelprize.org_. Retrieved 10 October 2024.\n7. ^ _a__b__c_\"Han Kang – Interview\". _nobelprize.org_. Retrieved 10 October 2024.\n8. ^\"SVT:s Nobelpanel oense om litteraturpristagaren: \"Ingen kommer minnas\"\" (in Swedish). SVT Nyheter. 10 October 2024.", "score": 0.96897686}, {"title": "Announcement of the 2024 Nobel Prize in Literature - YouTube", "url": "https://www.youtube.com/watch?v=OnwYMuLL2E0", "content": "# Announcement of the 2024 Nobel Prize in Literature\n## Nobel Prize\n728000 subscribers\n3373 likes\n\n### Description\n132165 views\nPosted: 10 Oct 2024\nThe Nobel Prize in Literature for 2024 is awarded to the South Korean author Han Kang, “for her intense poetic prose that confronts historical traumas and exposes the fragility of human life”.\n \n#NobelPrize \n\nLive stream terms of use: [...] very welcome to the Swedish Academy my name is mat small I feel the function of permanent secretary the academy has convened and can now announce its decision on the Nobel Prize in literature leer manif sarit the Nobel Prize in literature for 2024 for is awarded to South Korean author Han Kang for her intense poetic Pros that confronts historical traas and exposes the fragility of human life December I was able to talk to Han Kong on the phone she was having a an ordinary day it seems had just", "score": 0.95089215}, {"title": "2024 Nobel Prize in Literature - The works of Han Kang - YouTube", "url": "https://www.youtube.com/watch?v=REG68Po2EvE", "content": "3 comments\n### Transcript:\n The South Korean author Han Kang was awarded the 2024 literature prize. In her works, Han confronts historical traumas and unspoken rules, and portrays human vulnerability. Her international breakthrough came with the novel 'The Vegetarian', in which a woman's choice to stop eating meat has\nviolent consequences. Here, the woman's husband describes a family dinner. [...] # The works of Han Kang | One-minute crash course | 2024 Nobel Prize in Literature\n## Nobel Prize\n723000 subscribers\n193 likes\n\n### Description\n7436 views\nPosted: 21 Nov 2024\nDo you know the South Korean author Han Kang? \n\nHer works confront historical traumas, unspoken rules and portray human vulnerability.\n\nThe Nobel Prize in Literature 2024 was awarded to Han Kang “for her intense poetic prose that confronts historical traumas and exposes the fragility of human life.” [...] Read more about the 2024 literature prize: \n\nFor teachers/schools: Find the Nobel Prize lesson on the 2024 literature prize at: \n\nQuote from The Vegetarian (2007), Hogarth, 2015, translated by Deborah Smith\n\nIllustrations: Patrik Fredriksson", "score": 0.94135845}]
================================== Ai Message ==================================
2024년 노벨문학상 수상자는 한국의 작가 한강입니다. 그녀는 "역사적 트라우마에 맞서고 인간 삶의 연약함을 드러내는 강렬한 시적 산문"으로 이 상을 수상하였습니다. 이 발표는 2024년 10월 10일 스웨덴 아카데미에 의해 이루어졌습니다. 한강은 한국인 최초이자 아시아 여성으로서 노벨문학상을 수상한 첫 번째 인물입니다.
더 자세한 내용은 [여기](https://en.wikipedia.org/wiki/2024_Nobel_Prize_in_Literature)에서 확인하실 수 있습니다.
# case 2: 내부 문서 검색이 필요한 경우
inputs = {
"messages": "카카오가 개발한 모델에 대해 알려주세요."
}
try:
response = graph.invoke(inputs)
except GraphRecursionError as e:
print("Recursion Error")
for msg in response["messages"]:
msg.pretty_print()
##### HI ! #####
response content='' additional_kwargs={'tool_calls': [{'id': 'call_9U4Ek1d3Ms4GsWzQDXZJGZW8', 'function': {'arguments': '{"query":"카카오 모델 개발"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None} response_metadata={'token_usage': {'completion_tokens': 23, 'prompt_tokens': 103, 'total_tokens': 126, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxXzZPoqMyVLkHivXe1WeNeU6zTY', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None} id='run--7a572338-0862-48fe-b2be-021d246bb450-0' tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '카카오 모델 개발'}, 'id': 'call_9U4Ek1d3Ms4GsWzQDXZJGZW8', 'type': 'tool_call'}] usage_metadata={'input_tokens': 103, 'output_tokens': 23, 'total_tokens': 126, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### RETRIEVE #####
##### CHECK RELEVANCE #####
state[messages] [HumanMessage(content='카카오가 개발한 모델에 대해 알려주세요.', additional_kwargs={}, response_metadata={}, id='25a2fe80-5e10-4bde-a4e8-f944aff95fc8'), AIMessage(content='', additional_kwargs={'tool_calls': [{'id': 'call_9U4Ek1d3Ms4GsWzQDXZJGZW8', 'function': {'arguments': '{"query":"카카오 모델 개발"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 23, 'prompt_tokens': 103, 'total_tokens': 126, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxXzZPoqMyVLkHivXe1WeNeU6zTY', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None}, id='run--7a572338-0862-48fe-b2be-021d246bb450-0', tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '카카오 모델 개발'}, 'id': 'call_9U4Ek1d3Ms4GsWzQDXZJGZW8', 'type': 'tool_call'}], usage_metadata={'input_tokens': 103, 'output_tokens': 23, 'total_tokens': 126, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}})]
question 카카오가 개발한 모델에 대해 알려주세요.
context SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
context SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
grade yes
---GRADE: DOCUMENT RELEVANT---
##### ASSESS GRADED DOCUMENTS #####
---DECISION: GENERATE---
##### GENERATE #####
question 카카오가 개발한 모델에 대해 알려주세요.
context SPRi AI Brief2025년 4월호
20
카카오, 자체 개발 AI 모델 ‘카나나’의 테크니컬 리포트 공개n카카오가 자체 개발 LLM ‘카나나’의 테크니컬 리포트를 공개하고, 카나나에 단계별 사전학습과 가지치기, 지식증류 등의 학습 기법을 적용해 학습 효율성을 극대화했다고 설명 n카카오는 연구 목적의 활용을 지원하기 위해 온디바이스 환경에서 작동될 수 있는 경량 모델 ‘카나나 나노 2.1B’를 오픈소스로 공개
KEY Contents
£카나나, 단계별 사전학습과 지식 증류 등의 학습 기법으로 학습 효율성 극대화n카카오가 2025년 2월 27일 자체 개발 언어모델 ‘카나나(Kanana)’의 구조와 학습 과정, 성능을 상세히 다룬 테크니컬 리포트*를 공개* Kanana: Compute-efficient Bilingual Language Models(https://arxiv.org/html/2502.18934v3/)∙카카오는 2024년 10월 개발자 컨퍼런스 ‘if(kakaoAI)2024’에서 카나나 언어모델 라인업(카나나 플래그, 에센스, 나노)을 처음 공개했으며, 2024년 말 카나나 플래그의 개발을 완료해 전체 라인업을 구축∙카카오에 따르면 카나나 플래그는 글로벌 최고 수준의 한국어·영어 성능을 보였으며, 특히 한국어 지식을 평가하는 벤치마크 KMMLU에서는 경쟁 모델을 압도하는 한국어 처리 성능을 달성** Kanana Flag 32.5B: 64.19, Qwen2.5B 32B: 59.37, Gemma2 27B: 49.98, EXAONE-3.5-32B: 55.44n카카오는 카나나의 학습 효율을 극대화하기 위해 단계별 사전학습(Staged Pre-training), 가지치기(Pruning)*, 지식 증류(Distillation)**와 같은 다양한 학습 기법을 적용했다고 설명*모델 구성 요소를 가지치기해 중요 요소만 남기는 기법 **큰 모델의 지식을 더 작은 모델로 전달하는 기법∙먼저 단계별 사전학습을 통해 8B와 26.8B 크기의 모델을 각각 학습하고, 8B 모델을 바탕으로 모델 최적화를 위한 가지치기와 증류 과정을 거쳐 경량 모델 카나나 나노 2.1B를 구축∙또한 8B와 26.8B 모델에 ‘깊이 업스케일링(Depth UP-Scaling)*’ 기법을 적용하여 카나나 에센스 9.8B와 카나나 플래그 32.5B를 개발*기존 모델의 레이어를 더 많이 쌓아 올려 모델 규모를 효과적으로 키우는 방식∙이처럼 이미 학습된 모델을 활용해 다양한 크기의 모델을 개발함으로써 유사 크기의 글로벌 모델 대비 절반 이하의 학습 비용으로 학습 자원을 최적화했다고 강조(Qwen 2.5 대비 18% 수준) £카카오, 연구 목적의 활용을 위해 카나나 나노 2.1B 오픈소스 공개n한편, 카카오는 카나나 언어모델 중 연구 목적으로 활용할 수 있도록 ‘카나나 나노 2.1B’의 base 및 instruct 버전과 문서 임베딩용* 버전을 깃허브(Github)에 오픈소스로 공개 * 텍스트 문서의 내용을 컴퓨터가 이해할 수 있는 숫자 형태로 변환하는 기술∙카카오에 따르면 카카오 나노 2.1B는 온디바이스 환경에서 원활하게 구동되도록 설계되었으며 비교적 작은 모델임에도 유사 크기의 글로벌 모델과 견줄 수 있는 성능을 발휘하나, 경량 모델 특성상 복잡한 추론이나 수학 문제 해결 등 고난도 태스크에서는 한계를 내포출처 | 카카오, 카카오의 언어모델, Kanana 테크니컬 리포트 공개, 2025.02.27.
response content="카카오는 자체 개발한 언어 모델 '카나나(Kanana)'의 테크니컬 리포트를 공개했습니다. 이 모델은 단계별 사전학습, 가지치기, 지식 증류 등의 기법을 통해 학습 효율성을 극대화하였으며, 경량 모델 '카나나 나노 2.1B'를 오픈소스로 제공하고 있습니다. 카나나는 한국어와 영어 성능에서 글로벌 최고 수준을 자랑합니다." additional_kwargs={'refusal': None} response_metadata={'token_usage': {'completion_tokens': 104, 'prompt_tokens': 1041, 'total_tokens': 1145, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxY1JMPu2n6VBBmeetQZXwqwNgeg', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None} id='run--943894c2-86bc-4247-9e08-5476824defce-0' usage_metadata={'input_tokens': 1041, 'output_tokens': 104, 'total_tokens': 1145, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### CHECK HALLUCINATIONS #####
---DECISION: GENERATION IS GROUNDED IN DOCUMENTS---
---DECISION: GENERATION ADDRESSES QUESTION---
================================ Human Message =================================
카카오가 개발한 모델에 대해 알려주세요.
================================== Ai Message ==================================
Tool Calls:
retrieve_ai_policy_april_2025 (call_9U4Ek1d3Ms4GsWzQDXZJGZW8)
Call ID: call_9U4Ek1d3Ms4GsWzQDXZJGZW8
Args:
query: 카카오 모델 개발
================================== Ai Message ==================================
카카오는 자체 개발한 언어 모델 '카나나(Kanana)'의 테크니컬 리포트를 공개했습니다. 이 모델은 단계별 사전학습, 가지치기, 지식 증류 등의 기법을 통해 학습 효율성을 극대화하였으며, 경량 모델 '카나나 나노 2.1B'를 오픈소스로 제공하고 있습니다. 카나나는 한국어와 영어 성능에서 글로벌 최고 수준을 자랑합니다.
inputs = {
"messages": "마누스 AI 에이전트에 대한 장단점"
}
try:
response = graph.invoke(inputs)
except GraphRecursionError as e:
print("Recursion Error")
for msg in response["messages"]:
msg.pretty_print()
##### HI ! #####
response content='' additional_kwargs={'tool_calls': [{'id': 'call_UAf5YflYSXkKwZ1ytv9uHniL', 'function': {'arguments': '{"query":"마누스 AI 에이전트 장단점"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None} response_metadata={'token_usage': {'completion_tokens': 30, 'prompt_tokens': 105, 'total_tokens': 135, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZWMA6avnRSPuYg1eCxromeQCAA', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None} id='run--adb23c5e-0a83-4718-89af-bdae023fce89-0' tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '마누스 AI 에이전트 장단점'}, 'id': 'call_UAf5YflYSXkKwZ1ytv9uHniL', 'type': 'tool_call'}] usage_metadata={'input_tokens': 105, 'output_tokens': 30, 'total_tokens': 135, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### RETRIEVE #####
##### CHECK RELEVANCE #####
state[messages] [HumanMessage(content='마누스 AI 에이전트에 대한 장단점', additional_kwargs={}, response_metadata={}, id='de98bb5b-336b-4780-bdd1-2a813c313760'), AIMessage(content='', additional_kwargs={'tool_calls': [{'id': 'call_UAf5YflYSXkKwZ1ytv9uHniL', 'function': {'arguments': '{"query":"마누스 AI 에이전트 장단점"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 30, 'prompt_tokens': 105, 'total_tokens': 135, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZWMA6avnRSPuYg1eCxromeQCAA', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None}, id='run--adb23c5e-0a83-4718-89af-bdae023fce89-0', tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '마누스 AI 에이전트 장단점'}, 'id': 'call_UAf5YflYSXkKwZ1ytv9uHniL', 'type': 'tool_call'}], usage_metadata={'input_tokens': 105, 'output_tokens': 30, 'total_tokens': 135, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}})]
question 마누스 AI 에이전트에 대한 장단점
context SPRi AI Brief2025년 4월호
12
마누스 AI, 완전 자율 AI 에이전트 ‘마누스’ 공개n중국의 AI 스타트업 마누스 AI가 다양한 작업을 인간의 개입 없이 독립적으로 실행할 수 있는 완전 자율 AI 에이전트 ‘마누스’를 발표하고 초대 시스템을 통해 일부 사용자에게 제공n마누스는 앤스로픽 클로드와 알리바바 큐원 등 기존 LLM을 활용한 다중 에이전트 시스템으로 설계되었으며, 최초의 완전 자율 AI 에이전트라는 점에서 제2의 딥시크라는 평가도 존재
KEY Contents
£마누스 AI, 인간의 개입 없이 독립적으로 작업 수행하는 AI 에이전트 발표 n중국 AI 스타트업 마누스 AI(Manus AI)가 2025년 3월 5일 유튜브와 전용 웹사이트를 통해 완전 자율 AI 에이전트 ‘마누스’를 공개∙마누스 AI는 전용 웹사이트(Manus.im)에서 마누스가 “사고와 행동을 연결하는 세계 최초의 범용 AI 에이전트로, 업무와 일상의 다양한 작업에서 뛰어난 능력을 발휘”한다고 주장∙웹사이트에 소개된 활용 사례에 따르면 마누스는 여행계획 수립, 부동산 조사, 보험 정책 비교 등 다양한 작업을 인간의 개입 없이 독립적으로 수행하며, 일례로 이력서 파일을 받으면 후보자 순위 결정을 넘어 후보자들의 보유 기술을 추출하고 일자리 동향과 교차 참조하여 최적화된 채용 결정을 제시∙마누스 AI는 마누스가 GAIA(General AI Assistants)* 벤치마크 테스트에서 오픈AI의 딥 리서치를 능가하는 최고 점수를 달성했다고 보고*** AI 모델의 추론, 멀티모달 처리, 웹 브라우징, 도구 사용 등 복잡한 능력을 평가하는 벤치마크로 3가지 난이도로 구성** (GAIA 레벨별 성능 비교) Level 1: Manus.ai 86.5%, OpenAI Deep Research 74.3%/Level 2: Manus.ai 70.1%, OpenAI Deep Research 69.1%/Level 3 : Manus.ai 57.7%, OpenAI Deep Research 47.6% ∙마누스는 초대 코드를 통해서만 접근을 허용하는 비공개 테스트 단계로, 마누스 AI는 서버 용량 제한으로 인해 초대 시스템이 불가피하며 이를 해결하기 위해 노력 중이라고 설명n미국 경제매체 포브스(Forbes)는 마누스가 “인간의 조수에 그치지 않고 인간을 대체하는 세계 최초의 완전 자율 AI 에이전트”라며, 제2의 딥시크라고 평가했으나 부정적인 평가도 존재∙포브스에 따르면 마누스는 앤스로픽 클로드(Claude)와 알리바바 큐원(Qwen)과 같은 기존 LLM 기반 다중 에이전트 시스템으로 설계되어 복잡한 작업을 구성 요소별로 나누어 적절한 에이전트에 할당하고 진행 상황을 감독하며, 사용자의 개입 없이 백그라운드에서 작업을 수행한 뒤 완료되면 사용자에게 안내∙일부 초기 테스터 사이에서 정보 검색 실수와 시스템 다운을 비롯한 마누스의 오류나 단점에 대한 지적도 나오고 있으나, 포브스는 정식 출시에 앞서 시스템이 개선될 것으로 예상∙그러나 미국의 IT 미디어 테크크런치(TechCrunch)는 마누스가 사용자에게 잘못된 답변을 제시하거나 주문이나 예약 프로세스에 종종 실패하는 등 잦은 오류를 보였으며, 딥시크와 달리 자체적으로 모델을 개발하지도 않았다며 제2의 딥시크라는 표현은 과장되었다고 지적출처 | Manus AI, Introducing Manus: The General AI Agent, 2025.03.05. Forbes, China’s Autonomous Agent, Manus, Changes Everything, 2025.03.08.
context SPRi AI Brief2025년 4월호
12
마누스 AI, 완전 자율 AI 에이전트 ‘마누스’ 공개n중국의 AI 스타트업 마누스 AI가 다양한 작업을 인간의 개입 없이 독립적으로 실행할 수 있는 완전 자율 AI 에이전트 ‘마누스’를 발표하고 초대 시스템을 통해 일부 사용자에게 제공n마누스는 앤스로픽 클로드와 알리바바 큐원 등 기존 LLM을 활용한 다중 에이전트 시스템으로 설계되었으며, 최초의 완전 자율 AI 에이전트라는 점에서 제2의 딥시크라는 평가도 존재
KEY Contents
£마누스 AI, 인간의 개입 없이 독립적으로 작업 수행하는 AI 에이전트 발표 n중국 AI 스타트업 마누스 AI(Manus AI)가 2025년 3월 5일 유튜브와 전용 웹사이트를 통해 완전 자율 AI 에이전트 ‘마누스’를 공개∙마누스 AI는 전용 웹사이트(Manus.im)에서 마누스가 “사고와 행동을 연결하는 세계 최초의 범용 AI 에이전트로, 업무와 일상의 다양한 작업에서 뛰어난 능력을 발휘”한다고 주장∙웹사이트에 소개된 활용 사례에 따르면 마누스는 여행계획 수립, 부동산 조사, 보험 정책 비교 등 다양한 작업을 인간의 개입 없이 독립적으로 수행하며, 일례로 이력서 파일을 받으면 후보자 순위 결정을 넘어 후보자들의 보유 기술을 추출하고 일자리 동향과 교차 참조하여 최적화된 채용 결정을 제시∙마누스 AI는 마누스가 GAIA(General AI Assistants)* 벤치마크 테스트에서 오픈AI의 딥 리서치를 능가하는 최고 점수를 달성했다고 보고*** AI 모델의 추론, 멀티모달 처리, 웹 브라우징, 도구 사용 등 복잡한 능력을 평가하는 벤치마크로 3가지 난이도로 구성** (GAIA 레벨별 성능 비교) Level 1: Manus.ai 86.5%, OpenAI Deep Research 74.3%/Level 2: Manus.ai 70.1%, OpenAI Deep Research 69.1%/Level 3 : Manus.ai 57.7%, OpenAI Deep Research 47.6% ∙마누스는 초대 코드를 통해서만 접근을 허용하는 비공개 테스트 단계로, 마누스 AI는 서버 용량 제한으로 인해 초대 시스템이 불가피하며 이를 해결하기 위해 노력 중이라고 설명n미국 경제매체 포브스(Forbes)는 마누스가 “인간의 조수에 그치지 않고 인간을 대체하는 세계 최초의 완전 자율 AI 에이전트”라며, 제2의 딥시크라고 평가했으나 부정적인 평가도 존재∙포브스에 따르면 마누스는 앤스로픽 클로드(Claude)와 알리바바 큐원(Qwen)과 같은 기존 LLM 기반 다중 에이전트 시스템으로 설계되어 복잡한 작업을 구성 요소별로 나누어 적절한 에이전트에 할당하고 진행 상황을 감독하며, 사용자의 개입 없이 백그라운드에서 작업을 수행한 뒤 완료되면 사용자에게 안내∙일부 초기 테스터 사이에서 정보 검색 실수와 시스템 다운을 비롯한 마누스의 오류나 단점에 대한 지적도 나오고 있으나, 포브스는 정식 출시에 앞서 시스템이 개선될 것으로 예상∙그러나 미국의 IT 미디어 테크크런치(TechCrunch)는 마누스가 사용자에게 잘못된 답변을 제시하거나 주문이나 예약 프로세스에 종종 실패하는 등 잦은 오류를 보였으며, 딥시크와 달리 자체적으로 모델을 개발하지도 않았다며 제2의 딥시크라는 표현은 과장되었다고 지적출처 | Manus AI, Introducing Manus: The General AI Agent, 2025.03.05. Forbes, China’s Autonomous Agent, Manus, Changes Everything, 2025.03.08.
grade yes
---GRADE: DOCUMENT RELEVANT---
##### ASSESS GRADED DOCUMENTS #####
---DECISION: GENERATE---
##### GENERATE #####
question 마누스 AI 에이전트에 대한 장단점
context SPRi AI Brief2025년 4월호
12
마누스 AI, 완전 자율 AI 에이전트 ‘마누스’ 공개n중국의 AI 스타트업 마누스 AI가 다양한 작업을 인간의 개입 없이 독립적으로 실행할 수 있는 완전 자율 AI 에이전트 ‘마누스’를 발표하고 초대 시스템을 통해 일부 사용자에게 제공n마누스는 앤스로픽 클로드와 알리바바 큐원 등 기존 LLM을 활용한 다중 에이전트 시스템으로 설계되었으며, 최초의 완전 자율 AI 에이전트라는 점에서 제2의 딥시크라는 평가도 존재
KEY Contents
£마누스 AI, 인간의 개입 없이 독립적으로 작업 수행하는 AI 에이전트 발표 n중국 AI 스타트업 마누스 AI(Manus AI)가 2025년 3월 5일 유튜브와 전용 웹사이트를 통해 완전 자율 AI 에이전트 ‘마누스’를 공개∙마누스 AI는 전용 웹사이트(Manus.im)에서 마누스가 “사고와 행동을 연결하는 세계 최초의 범용 AI 에이전트로, 업무와 일상의 다양한 작업에서 뛰어난 능력을 발휘”한다고 주장∙웹사이트에 소개된 활용 사례에 따르면 마누스는 여행계획 수립, 부동산 조사, 보험 정책 비교 등 다양한 작업을 인간의 개입 없이 독립적으로 수행하며, 일례로 이력서 파일을 받으면 후보자 순위 결정을 넘어 후보자들의 보유 기술을 추출하고 일자리 동향과 교차 참조하여 최적화된 채용 결정을 제시∙마누스 AI는 마누스가 GAIA(General AI Assistants)* 벤치마크 테스트에서 오픈AI의 딥 리서치를 능가하는 최고 점수를 달성했다고 보고*** AI 모델의 추론, 멀티모달 처리, 웹 브라우징, 도구 사용 등 복잡한 능력을 평가하는 벤치마크로 3가지 난이도로 구성** (GAIA 레벨별 성능 비교) Level 1: Manus.ai 86.5%, OpenAI Deep Research 74.3%/Level 2: Manus.ai 70.1%, OpenAI Deep Research 69.1%/Level 3 : Manus.ai 57.7%, OpenAI Deep Research 47.6% ∙마누스는 초대 코드를 통해서만 접근을 허용하는 비공개 테스트 단계로, 마누스 AI는 서버 용량 제한으로 인해 초대 시스템이 불가피하며 이를 해결하기 위해 노력 중이라고 설명n미국 경제매체 포브스(Forbes)는 마누스가 “인간의 조수에 그치지 않고 인간을 대체하는 세계 최초의 완전 자율 AI 에이전트”라며, 제2의 딥시크라고 평가했으나 부정적인 평가도 존재∙포브스에 따르면 마누스는 앤스로픽 클로드(Claude)와 알리바바 큐원(Qwen)과 같은 기존 LLM 기반 다중 에이전트 시스템으로 설계되어 복잡한 작업을 구성 요소별로 나누어 적절한 에이전트에 할당하고 진행 상황을 감독하며, 사용자의 개입 없이 백그라운드에서 작업을 수행한 뒤 완료되면 사용자에게 안내∙일부 초기 테스터 사이에서 정보 검색 실수와 시스템 다운을 비롯한 마누스의 오류나 단점에 대한 지적도 나오고 있으나, 포브스는 정식 출시에 앞서 시스템이 개선될 것으로 예상∙그러나 미국의 IT 미디어 테크크런치(TechCrunch)는 마누스가 사용자에게 잘못된 답변을 제시하거나 주문이나 예약 프로세스에 종종 실패하는 등 잦은 오류를 보였으며, 딥시크와 달리 자체적으로 모델을 개발하지도 않았다며 제2의 딥시크라는 표현은 과장되었다고 지적출처 | Manus AI, Introducing Manus: The General AI Agent, 2025.03.05. Forbes, China’s Autonomous Agent, Manus, Changes Everything, 2025.03.08.
response content='마누스 AI 에이전트의 장점은 인간의 개입 없이 다양한 작업을 독립적으로 수행할 수 있는 완전 자율성입니다. 그러나 초기 테스터들 사이에서 정보 검색 오류와 시스템 다운 등 단점도 지적되고 있으며, 사용자에게 잘못된 답변을 제시하는 경우도 발생하고 있습니다. 이러한 문제에도 불구하고, 정식 출시 전에 시스템 개선이 예상되고 있습니다.' additional_kwargs={'refusal': None} response_metadata={'token_usage': {'completion_tokens': 91, 'prompt_tokens': 1008, 'total_tokens': 1099, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_51db84afab', 'id': 'chatcmpl-CGxZYydR4UigGqRsRFTQzC8Y8ADCw', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None} id='run--ecaa10cc-5aea-4831-a987-3ca627294bd5-0' usage_metadata={'input_tokens': 1008, 'output_tokens': 91, 'total_tokens': 1099, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### CHECK HALLUCINATIONS #####
---DECISION: GENERATION IS GROUNDED IN DOCUMENTS---
---DECISION: GENERATION ADDRESSES QUESTION---
================================ Human Message =================================
마누스 AI 에이전트에 대한 장단점
================================== Ai Message ==================================
Tool Calls:
retrieve_ai_policy_april_2025 (call_UAf5YflYSXkKwZ1ytv9uHniL)
Call ID: call_UAf5YflYSXkKwZ1ytv9uHniL
Args:
query: 마누스 AI 에이전트 장단점
================================== Ai Message ==================================
마누스 AI 에이전트의 장점은 인간의 개입 없이 다양한 작업을 독립적으로 수행할 수 있는 완전 자율성입니다. 그러나 초기 테스터들 사이에서 정보 검색 오류와 시스템 다운 등 단점도 지적되고 있으며, 사용자에게 잘못된 답변을 제시하는 경우도 발생하고 있습니다. 이러한 문제에도 불구하고, 정식 출시 전에 시스템 개선이 예상되고 있습니다.
# case 3: 부실한 사용자 쿼리를 재작성한 후 재 검색 및 답변
inputs = {
"messages": "구글 AI AI AI"
}
try:
response = graph.invoke(inputs)
except GraphRecursionError as e:
print("Recursion Error")
for msg in response["messages"]:
msg.pretty_print()
##### HI ! #####
response content='' additional_kwargs={'tool_calls': [{'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'function': {'arguments': '{"query":"구글 AI"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None} response_metadata={'token_usage': {'completion_tokens': 22, 'prompt_tokens': 97, 'total_tokens': 119, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZwtPGvujkJnapWVi4C0bENSYQd', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None} id='run--6c9de55a-a2a6-4d53-befa-1c503a9923f2-0' tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '구글 AI'}, 'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'type': 'tool_call'}] usage_metadata={'input_tokens': 97, 'output_tokens': 22, 'total_tokens': 119, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### RETRIEVE #####
##### CHECK RELEVANCE #####
state[messages] [HumanMessage(content='구글 AI AI AI', additional_kwargs={}, response_metadata={}, id='771cf241-cce9-4c9d-96fc-60f5b59aa54c'), AIMessage(content='', additional_kwargs={'tool_calls': [{'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'function': {'arguments': '{"query":"구글 AI"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 22, 'prompt_tokens': 97, 'total_tokens': 119, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZwtPGvujkJnapWVi4C0bENSYQd', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None}, id='run--6c9de55a-a2a6-4d53-befa-1c503a9923f2-0', tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '구글 AI'}, 'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'type': 'tool_call'}], usage_metadata={'input_tokens': 97, 'output_tokens': 22, 'total_tokens': 119, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}})]
question 구글 AI AI AI
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
grade yes
---GRADE: DOCUMENT RELEVANT---
##### ASSESS GRADED DOCUMENTS #####
---DECISION: GENERATE---
##### GENERATE #####
question 구글 AI AI AI
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
response content="구글 딥마인드는 로봇 제어를 위한 AI 모델 '제미나이 로보틱스'를 개발했습니다. 이 모델은 시각, 언어, 행동을 통합적으로 이해하며, 학습하지 않은 작업도 즉시 수행할 수 있는 범용성을 가지고 있습니다. 또한, '제미나이 로보틱스-ER' 모델은 물리적 세계에 대한 이해 능력을 강화하여 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있습니다." additional_kwargs={'refusal': None} response_metadata={'token_usage': {'completion_tokens': 111, 'prompt_tokens': 966, 'total_tokens': 1077, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZyDqBnu3ay6STThDPx4BPu9pkK', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None} id='run--7ba203d9-2fdb-454f-a02c-5fd807c88117-0' usage_metadata={'input_tokens': 966, 'output_tokens': 111, 'total_tokens': 1077, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### CHECK HALLUCINATIONS #####
---DECISION: GENERATION IS GROUNDED IN DOCUMENTS---
---DECISION: GENERATION DOES NOT ADDRESS QUESTION---
##### TRANSFORM QUERY #####
question 구글 AI AI AI
better_question 구글의 인공지능 기술에 대해 설명해 주실 수 있나요?
##### RETRIEVE #####
##### CHECK RELEVANCE #####
state[messages] [HumanMessage(content='구글 AI AI AI', additional_kwargs={}, response_metadata={}, id='771cf241-cce9-4c9d-96fc-60f5b59aa54c'), AIMessage(content='', additional_kwargs={'tool_calls': [{'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'function': {'arguments': '{"query":"구글 AI"}', 'name': 'retrieve_ai_policy_april_2025'}, 'type': 'function'}], 'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 22, 'prompt_tokens': 97, 'total_tokens': 119, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZwtPGvujkJnapWVi4C0bENSYQd', 'service_tier': 'default', 'finish_reason': 'tool_calls', 'logprobs': None}, id='run--6c9de55a-a2a6-4d53-befa-1c503a9923f2-0', tool_calls=[{'name': 'retrieve_ai_policy_april_2025', 'args': {'query': '구글 AI'}, 'id': 'call_Ru6OmXWv1HjDwc2yX8XFQdDo', 'type': 'tool_call'}], usage_metadata={'input_tokens': 97, 'output_tokens': 22, 'total_tokens': 119, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}), AIMessage(content="구글 딥마인드는 로봇 제어를 위한 AI 모델 '제미나이 로보틱스'를 개발했습니다. 이 모델은 시각, 언어, 행동을 통합적으로 이해하며, 학습하지 않은 작업도 즉시 수행할 수 있는 범용성을 가지고 있습니다. 또한, '제미나이 로보틱스-ER' 모델은 물리적 세계에 대한 이해 능력을 강화하여 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있습니다.", additional_kwargs={'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 111, 'prompt_tokens': 966, 'total_tokens': 1077, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxZyDqBnu3ay6STThDPx4BPu9pkK', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None}, id='run--7ba203d9-2fdb-454f-a02c-5fd807c88117-0', usage_metadata={'input_tokens': 966, 'output_tokens': 111, 'total_tokens': 1077, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}), AIMessage(content='구글의 인공지능 기술에 대해 설명해 주실 수 있나요?', additional_kwargs={'refusal': None}, response_metadata={'token_usage': {'completion_tokens': 17, 'prompt_tokens': 74, 'total_tokens': 91, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_560af6e559', 'id': 'chatcmpl-CGxa2UYVUJIUljpxZEXdpqoPJruhZ', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None}, id='run--f36e1267-fb7c-42b1-b268-4e7c7090b3a7-0', usage_metadata={'input_tokens': 74, 'output_tokens': 17, 'total_tokens': 91, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}})]
question 구글의 인공지능 기술에 대해 설명해 주실 수 있나요?
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
grade yes
---GRADE: DOCUMENT RELEVANT---
##### ASSESS GRADED DOCUMENTS #####
---DECISION: GENERATE---
##### GENERATE #####
question 구글의 인공지능 기술에 대해 설명해 주실 수 있나요?
context SPRi AI Brief2025년 4월호
16
구글 딥마인드, 로봇 특화 AI 모델 ‘제미나이 로보틱스’ 개발n구글 딥마인드는 제미나이 2.0 기반의 시각-언어-행동 모델로 로봇 직접 제어를 위한 물리적 동작이 출력으로 추가된 로봇 특화 AI 모델 ‘제미나이 로보틱스’를 공개n구글 딥마인드는 물리적 세계에 대한 이해 능력을 개선해 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있는 비전-언어 모델 ‘제미나이 로보틱스-ER’도 공개
KEY Contents
£‘제미나이 로보틱스’, 학습 과정에서 접하지 못한 작업도 즉각 수행하는 범용성 보유n구글 딥마인드(Google Deepmind)가 2025년 3월 12일 로봇 개발에 특화된 AI 모델 ‘제미나이 로보틱스(Gemini Robotics)’를 공개∙제미나이 2.0을 기반으로 구축된 제미나이 로보틱스는 첨단 시각-언어-행동(VLA) 모델로, 로봇을 직접 제어하기 위해 물리적 행동을 새로운 출력 형태로 추가했으며, 학습 과정에서 접하지 못한 새로운 물체나 환경에서도 기존에 학습한 지식을 응용해 다양한 작업을 즉각 수행하는 범용성을 보유* Vision-Language-Action: 시각, 언어, 행동을 통합적으로 이해하고 처리하는 AI 모델∙구글 딥마인드는 종합적인 범용성 벤치마크에서 제미나이 로보틱스가 다른 첨단 시각-언어-행동 모델보다 평균 두 배 이상의 성능 향상을 보였다고 보고*n구글 딥마인드에 따르면 제미나이 로보틱스는 제미나이의 언어 이해 능력을 바탕으로 일상적 대화체의 명령을 이해하고 다양한 언어로 답변할 수 있으며, 복잡한 다단계 작업도 수행 가능∙주변 환경을 지속적으로 모니터링하여 환경이나 명령의 변화를 감지하고 즉시 행동을 수정할 수 있어, 다양한 환경에서 로봇과 협력할 수 있도록 지원∙종이접기처럼 섬세한 운동 능력과 정밀한 조작을 요구하는 작업을 수행할 수 있으며, 로봇 유형별로 쉽게 적응할 수 있도록 설계되어 많은 연구실에서 사용되는 양팔 로봇 플랫폼뿐 아니라 휴머노이드 로봇과 같은 복잡한 형태에도 특화 가능£로봇 제어에 필요한 추론 수행 능력을 강화한 ‘제미나이 로보틱스-ER’도 공개n구글 딥마인드는 제미나이 로보틱스와 함께 첨단 시각-언어 모델 ‘제미나이 로보틱스-ER (Embodied Reasoning)’도 공개∙제미나이 로보틱스-ER은 물리적 세계에 대한 이해 능력을 향상한 모델로서, 3D 인식이나 상태 추정, 공간 이해, 계획과 코드 생성 등 로봇 제어에 필요한 모든 추론 단계를 즉각 수행 가능∙향상된 공간 추론 능력과 제미나이의 코딩 능력을 결합해 즉각적으로 새로운 기능을 구현할 수 있으며, 일례로 커피잔을 보여주면 잔을 들어올리기에 적합한 그립 방식과 안전한 접근 경로를 직관적으로 파악∙모델 안전성을 위해 충돌 회피와 같은 기본적인 안전 제어장치와 상호작용할 수 있으며, 제미나이의 안전 기능을 바탕으로 주어진 시나리오 안에서 안전한 동작을 판단하고, 질문에 적절한 답변을 생성하도록 설계 출처 | Google Deepmind, Gemini Robotics brings AI into the physical world, 2025.03.12.
response content="구글의 인공지능 기술 중 하나인 '제미나이 로보틱스'는 로봇 제어를 위한 시각-언어-행동 모델로, 물리적 동작을 출력으로 추가하여 다양한 작업을 즉각 수행할 수 있는 범용성을 가지고 있습니다. 이 모델은 복잡한 다단계 작업을 수행하고, 환경 변화를 감지하여 즉시 행동을 수정할 수 있는 능력을 갖추고 있습니다. 또한, '제미나이 로보틱스-ER'은 물리적 세계에 대한 이해 능력을 강화하여 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있도록 설계되었습니다." additional_kwargs={'refusal': None} response_metadata={'token_usage': {'completion_tokens': 147, 'prompt_tokens': 978, 'total_tokens': 1125, 'completion_tokens_details': {'accepted_prediction_tokens': 0, 'audio_tokens': 0, 'reasoning_tokens': 0, 'rejected_prediction_tokens': 0}, 'prompt_tokens_details': {'audio_tokens': 0, 'cached_tokens': 0}}, 'model_name': 'gpt-4o-mini-2024-07-18', 'system_fingerprint': 'fp_51db84afab', 'id': 'chatcmpl-CGxa5ukOFQ6ZpOHestZtkFc7jj0Lf', 'service_tier': 'default', 'finish_reason': 'stop', 'logprobs': None} id='run--0fc39cd2-86a5-4f3f-9191-c5855d500f53-0' usage_metadata={'input_tokens': 978, 'output_tokens': 147, 'total_tokens': 1125, 'input_token_details': {'audio': 0, 'cache_read': 0}, 'output_token_details': {'audio': 0, 'reasoning': 0}}
##### CHECK HALLUCINATIONS #####
---DECISION: GENERATION IS GROUNDED IN DOCUMENTS---
---DECISION: GENERATION ADDRESSES QUESTION---
================================ Human Message =================================
구글 AI AI AI
================================== Ai Message ==================================
Tool Calls:
retrieve_ai_policy_april_2025 (call_Ru6OmXWv1HjDwc2yX8XFQdDo)
Call ID: call_Ru6OmXWv1HjDwc2yX8XFQdDo
Args:
query: 구글 AI
================================== Ai Message ==================================
구글 딥마인드는 로봇 제어를 위한 AI 모델 '제미나이 로보틱스'를 개발했습니다. 이 모델은 시각, 언어, 행동을 통합적으로 이해하며, 학습하지 않은 작업도 즉시 수행할 수 있는 범용성을 가지고 있습니다. 또한, '제미나이 로보틱스-ER' 모델은 물리적 세계에 대한 이해 능력을 강화하여 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있습니다.
================================== Ai Message ==================================
구글의 인공지능 기술에 대해 설명해 주실 수 있나요?
================================== Ai Message ==================================
구글의 인공지능 기술 중 하나인 '제미나이 로보틱스'는 로봇 제어를 위한 시각-언어-행동 모델로, 물리적 동작을 출력으로 추가하여 다양한 작업을 즉각 수행할 수 있는 범용성을 가지고 있습니다. 이 모델은 복잡한 다단계 작업을 수행하고, 환경 변화를 감지하여 즉시 행동을 수정할 수 있는 능력을 갖추고 있습니다. 또한, '제미나이 로보틱스-ER'은 물리적 세계에 대한 이해 능력을 강화하여 로봇 제어에 필요한 모든 추론 단계를 즉각 수행할 수 있도록 설계되었습니다.