많은 현재 NLP 시스템이 단어를 ‘원자 단위 (Atomic Units)’로 취급한다. 해당 취급 과정은 단어 간의 유사성 개념이 없고 어휘를 그저 인덱스로 표현할 뿐이다. → 그냥 의미가 따로 없는 단어들을 인덱싱 하는 것이 방식은 단어 간 유사성 (Similarit

RNN, LSTM, 특히 GRU, LSTM은 언어모델링이나 기계 번역과 같은 시퀸스 처리 (Sequence modeling) 문제에서 ‘최고 수준(state-of-the-art)’ 기술로 자리 잡았었다. 📌 RNN은 문장처럼 순서가 있는 데이터를 처리하는 데 특화된

` ImageNet Classification with Deep Convolutional Neural Networks (2012) ` 논문을 읽고. . 이 논문에서는 AlexNet이라는 이름이 직접적으로 등장하지는 않지만, 이 논문이 말하고자 하는 모델이 AlexNe

이런 식으로 사진이 지직 거리는 느낌의 이미지를 본 적 있을 것이다. 이런 잡음을 가우시안 노이즈라고 한다. 이름처럼 가우스 함수에 따른 분포를 따르고 있기 때문에 가우시안 노이즈라고 이름이 붙여졌다. 가우시안 노이즈는 보통 이미지의 압축, 전송 등의 과정에서 발

이번에는 ViT를 PyTorch로 구현해보고자 한다.2021년 이후 Computer Vision의 Foundation Model로 빼먹을 수 없는 ViT.. 간단한 Image Classification Dataset을 사용하여 Image Classification을 위

A Simple Detector with Frame Dynamics is a Strong Tracker 최근 러-우 전쟁 등에서 드론의 중요성 및 위험성이 대두되고 있다. 때문에 드론을 추적하는 것이 매우 중요한 Task로 이어지는데, 본 논문은 일반 객체 탐지기
작성 중..

해당 논문을 이해하기 위해서는 LoRA에 대한 이해의 초석이 필요하다.자연어처리 분야에서는 일반적인 데이터로 대규모 pre-training을 진행하고, 특정 Task에 맞게 Fine-Tuning하는 것이 중요하다. 하지만 모델의 크기가 점점 커지면서, 모델의 모든 파라
2010년대 컴퓨터 비전 분야는 ResNetrㅘ 같은 ConvNet이 지배적이었다. ConvNet이 시각 인식 시스템의 기본 구성 요소로 자리잡을 수 있었던 이유는 Sliding Window 방식의 도움이 컸는데, 이는 고해상도 이미지 작업에 본질적이기 때문이다. Co

Agent Laboratory는 Human Researcher를 대체하기 위한 것이 아닌, 연구 생산성을 극대화하는 Assistant 역할을 수행한다.연구자는 기획과 비판적 사고에 집중하고, Agent는 코딩, 문헌 검색, 문서화 같은 반복적이고 시간 소모적인 작업을

기존 Mirror Detection은 거울과 비거울 영역 사이의 의미적⋅구조적 특징을 통합하거나, depth, chirality 같은 거울 속성을 추가 정보로 활용하는 방식에 집중해왔다.chiarlity: reality와 reflected 사이의 '좌우반전'의 기하학적

기존의 Crack Segmentation 연구들은 최근 선형 복잡도로 장거리 의존성을 모델링할 수 있는 Mamba 구조를 채택해 왔다. 하지만 기존 방식에는 한계가 있는데....

Source: Beyond-Labels: Advancing Open-Vocabulary Segmentation With Vision-Language Models

CV의 패러다임을 '고정된 레이블 집합'에 대한 지도 학습에서, 웹 스케일의 (이미지, 텍스트) 쌍을 활용한 '자연어 감독'으로 전환시킨 선구적인 연구이다. 제로샷(Zero-shot) 전이 학습의 새로운 가능성을 열었으며, 프롬프트 엔지니어링을 포함한 방법론을 제안한다

source: Training-Free Open-Ended Object Detectino and Segmentation via Attention as Prompts이 논문은 일반적인 open-set perception보다 더 빡센 문제를 잡습니다. 기존 open-set

GenerateU는 2024 CVPR 논문으로, 기존 객체 탐지의 한계를 넘은 새로운 패러다임을 제안합니다. open-ended task를 처음 정의한 논문입니다.

source: Open-Det: An Efficient Learning Framework for Open-Ended Detection 이 논문은 우리가 이전 포스트에서 다룬 GenerateU의 한계를 깨부순 새로운 모델이다. Abstract Open-Ended Ob

source: Segment Anything이번에 살펴볼 논문은 SAM: Segment Anything이다.본 포스트에서는 SAM의 모든 부분을 리뷰하지는 않고, 기존 Object detection의 proposal 개념을 SAM 방식으로 재해석하는 것에 초점을 맞추고
sources: SAM 3: Segment Anything with ConceptsSAM 3는 사용자가 지정한 하나의 물체를 분할하는 모델에서 사용자가 말한 개념에 해당하는 모든 물체를 찾아 분할하고 추적하는 모델로 SAM의 범위를 확장한 것이다.기존 SAM은 개념 전