sources: SAM 3: Segment Anything with ConceptsSAM 3는 사용자가 지정한 하나의 물체를 분할하는 모델에서 사용자가 말한 개념에 해당하는 모든 물체를 찾아 분할하고 추적하는 모델로 SAM의 범위를 확장한 것이다.기존 SAM은 개념 전

source: Segment Anything이번에 살펴볼 논문은 SAM: Segment Anything이다.본 포스트에서는 SAM의 모든 부분을 리뷰하지는 않고, 기존 Object detection의 proposal 개념을 SAM 방식으로 재해석하는 것에 초점을 맞추고
먼저 Grounding Model은 무엇일까요?"언어(Text)와 시각 정보(Image)의 물리적 위치를 정확하게 연결(Mapping)해 주는 모델"쉽게 말해, 기존의 AI가 이미지 전체를 보고 "이 사진엔 드론이 있네요"라고 단순 매칭(Image-Text Matchi

source: Open-Det: An Efficient Learning Framework for Open-Ended Detection 이 논문은 우리가 이전 포스트에서 다룬 GenerateU의 한계를 깨부순 새로운 모델이다. Abstract Open-Ended Ob

GenerateU는 2024 CVPR 논문으로, 기존 객체 탐지의 한계를 넘은 새로운 패러다임을 제안합니다. open-ended task를 처음 정의한 논문입니다.

source: Training-Free Open-Ended Object Detectino and Segmentation via Attention as Prompts이 논문은 일반적인 open-set perception보다 더 빡센 문제를 잡습니다. 기존 open-set

CV의 패러다임을 '고정된 레이블 집합'에 대한 지도 학습에서, 웹 스케일의 (이미지, 텍스트) 쌍을 활용한 '자연어 감독'으로 전환시킨 선구적인 연구이다. 제로샷(Zero-shot) 전이 학습의 새로운 가능성을 열었으며, 프롬프트 엔지니어링을 포함한 방법론을 제안한다

Source: Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models

기존의 Crack Segmentation 연구들은 최근 선형 복잡도로 장거리 의존성을 모델링할 수 있는 Mamba 구조를 채택해 왔다. 하지만 기존 방식에는 한계가 있는데....

기존 Mirror Detection은 거울과 비거울 영역 사이의 의미적⋅구조적 특징을 통합하거나, depth, chirality 같은 거울 속성을 추가 정보로 활용하는 방식에 집중해왔다.chiarlity: reality와 reflected 사이의 '좌우반전'의 기하학적
선형대수를 공부하는데, 갑자기 Dot product, Inner product 그리고 element-wise가 헷갈려 정리한다.이건 가장 기본이 되는 연산으로, 같은 위치의 원소끼리 곱한다. 중요한건, 결과는 같은 크기의 벡터/행렬인 것이다.$a = 1, 2, 3, b

SGD with Momentum, EMA, SMA, AdaGrad, RMSProp, 그리고 Adam에 대해서 다뤄본다

Agent Laboratory는 Human Researcher를 대체하기 위한 것이 아닌, 연구 생산성을 극대화하는 Assistant 역할을 수행한다.연구자는 기획과 비판적 사고에 집중하고, Agent는 코딩, 문헌 검색, 문서화 같은 반복적이고 시간 소모적인 작업을
2010년대 컴퓨터 비전 분야는 ResNetrㅘ 같은 ConvNet이 지배적이었다. ConvNet이 시각 인식 시스템의 기본 구성 요소로 자리잡을 수 있었던 이유는 Sliding Window 방식의 도움이 컸는데, 이는 고해상도 이미지 작업에 본질적이기 때문이다. Co
딥페이크 생성 AI는 보통 영상을 통쨰로 한 번에 만들지 못하고, 영상의 프레임을 한 장씩 조작한 뒤 이어 붙인다.따라서 정지된 한 장의 이미지는 완벽해 보일지 몰라도, 이 프레임들이 연속적으로 재생될 때 미세한 떨림, 픽셀의 튀는 현상, 부자연스러운 조명 변화 등이
안면 움직임 부호화 시스템(FACS)은 얼굴 근육의 미세한 변화를 실행 단위(Action Units)로 세분화하여 표정을 객관적으로 측정하는 전문적인 체계이다. 이 기술은 감정적인 주관성을 배제하고 근육의 움직임과 강도를 수치화함으로써, 심리학 및 임상 연구에서 신뢰할
딥페이크 생성 방식에는 크게 타겟과 소스를 통해 새로운 신원(Identity)를 생성하는 신원 조작(Identity Swap) 방식과 타겟이 소스를 모방하게 하는 표정 조작(Facial reenactment)가 있다.이 외에 우리가 주목하고자 하는 방식은미세 얼굴 근육

flash attention에 대해 알아보자.original transformerGPU 내부의 이야기Attention은 Q, K, V 세 가지 행렬로 계산한다.먼저 Query와 Key를 행렬곱 한다.이 결과가 Attention Score인데, 여기에 softmax를 씌

변환 행렬 (Transformation Matrix)란? 카메라가 움직이면 (Ego-motion), 화면 속의 모든 배경 픽셀들이 한꺼번에 이동한다. 변환 행렬은 '이전 프레임의 픽셀들이 현재 프레임에서 어디로 이동했는가?'를 설명해주는 수학적인 '지도' 역할을 해주는