
소스트리는 Git 사용을 도와주는 GUI 프로그램버튼을 클릭하는 방식으로 필요한 명령을 실행할 수 있도록 도와주기 때문에 편리하다.

Git 과 GitHub 을 대강 사용할 줄은 알지만, repository 정리나 git 명령어 등 심화적인 내용을 더 알고자, 도서관에서 책을 하나 빌렸다. 아는 내용은 skip 하고 정리할 부분만 정리해보았다.

Git과 GitHub는 개발의 효율성을 높이고, 협업을 원활하게 하며, 안전하고 체계적으로 프로젝트를 관리할 수 있는 도구입니다. 따라서 많은 개발자들이 이를 사용하고 있으며, 특히 팀 개발이나 오픈 소스 프로젝트에서 필수적인 도구로 자리 잡고 있습니다.

데이터 전처리는 머신러닝 프로젝트에서 가장 중요하면서도 가장 많은 시간이 소요되는 과정이다. 아무리 뛰어난 AI 모델을 사용하더라도 데이터 품질이 좋지 않으면 좋은 결과를 기대하기 어렵다.

데이터 시각화는 단순히 그래프를 그리는 기술이 아니라 데이터를 이해하고 전달하는 과정이다. 같은 데이터라도 어떤 그래프를 선택하느냐에 따라 전달되는 정보가 달라질 수 있다. 따라서 데이터의 특성과 분석 목적에 맞는 그래프를 선택하는 것이 중요하다.

EDA는 데이터를 단순히 살펴보는 과정이 아니라, 데이터를 이해하는 과정이다. 결측치와 이상치를 확인하고, 데이터의 분포와 변수 간 관계를 분석하면서 데이터가 가진 특성을 파악할 수 있다.

Pandas는 Python의 데이터 분석 및 조작을 위한 핵심 라이브러리입니다. 엑셀의 스프레드시트와 테이블 형식의 데이터 (DataFrame)을 쉽고 직관적으로 다룰 수 있게 해주는 도구입니다.

데이터 분석 과정에서 가장 기본이 되는 것은 다루고 있는 데이터의 타입과 성격을 정확히 이해하는 것이다. 환자의 나이, 성별, 혈압, 진료과 등 각기 다른 특성을 가진 데이터들은 서로 다른 분석 방법이 필요하다.

가중합(Weighted Sum)은 AI가 여러 정보를 종합해서 하나의 예측값을 만드는 가장 기본적인 방법입니다. 각 정보에 중요도(가중치)를 곱해서 모두 더하는 것입니다.

의료 현장에서 수학적 사고는 단순한 계산이 아닙니다. 환자의 생명과 직결된 논리적 판단의 도구입니다. NumPy는 AI와 머신러닝의 핵심 도구입니다. 의료 현장에서 환자 데이터 분석, 의료 영상 처리, 진단 예측 모델 등을 구현할 때 반드시 사용되는 라이브러리입니다.

파일 입출력은 프로그램에서 외부 파일에 데이터를 저장하거나 읽어오는 작업입니다. 메모리에 있는 데이터는 프로그램이 종료되면 사라지지만, 파일에 저장하면 영구적으로 보존됩니다.

객체지향 프로그래밍(OOP)은 데이터를 어떻게 구조화하는지 정의하고 해당 데이터를 수정할 수 있는 함수를 제공하는 프로그래밍 방식입니다.

함수는 특정 작업을 수행하는 코드 블록으로, 재사용 가능하고 코드를 깔끔하게 정리할 수 있게 해줍니다. 의료 현장에서는 환자 데이터 처리, 검사 결과 분석, 처방전 생성 등 반복적인 작업이 많기 때문에 함수를 통한 코드 재사용이 매우 중요합니다.

반복문은 특정 조건에 따라 똑같은 기능을 반복해서 수행하는 구문입니다. 의료 현장에서는 여러 환자의 데이터를 처리하거나, 검사 결과를 순차적으로 분석할 때 반복문이 필수적입니다.

조건문은 주어진 조건에 따라 다른 코드를 실행하는 구문입니다. 의료 현장에서는 환자의 상태나 검사 결과에 따라 다른 처치를 결정해야 하므로 조건문이 매우 중요합니다. 조건문은 조건식과 실행구문으로 이루어져 있습니다.

자료구조는 많은 양의 데이터를 체계적으로 다루는 방법입니다. 파이썬에는 여러 데이터를 효율적으로 관리하는 4가지 주요 자료구조가 있습니다.