ABOUT ME

-

Today
-
Yesterday
-
Total
-
  • [메타코드 AI LLM 부트캠프] 4주차 학습 일지: 6주차 딥러닝 과제 & 4주차 머신러닝 분류 학습
    공부/메타코드 LLM 부트캠프 2026. 3. 9. 13:47

    1. 주간 학습 회고

    이번 주는 지난주에 이어 6주 차 과제물 제출과 밀려있던 4주 차 강의 학습을 진행습니다.

    중간에 장례 일정이 있어 하루 정도 학습을 진행하지 못했고 과제물의 양도 생각보다 많아 완료까지 4일이 걸렸습니다.

    하나씩 차근차근 해결하며 과제를 무사히 제출한 뒤 남은 금 토 일요일 동안 4주 차 강의를 수강했습니다

     

    4주 차 강의는 회귀분석과 머신러닝의 지도학습 분류 문제 등을 다루었으며 분량이 약 20시간에 달해 걱정이 앞습니다.

    하지만 이론 실습 심화이론 실습으로 이어지는 반복적인 커리큘럼 덕분에 공통된 내용을 여러 번 점검하며

    수월하게 이해도를 높일 수 있습니다.

     

    다만 머신러닝 분류 심화 부분에서 아쉬움이 남았습니다.

    이론과 수학적 증명에만 치우친 설명 탓에 개발자 입장에서는 이것이 왜 필요한지 어떻게 쓰이는지에 대한 맥락을 잡기 어려웠다. 예를 들어 하이퍼플레인을 설명할 때 p 차원에서의 하이퍼플레인은 p-1 차원에서의 평평한 어핀 공간이라는 수학적 정의와 수식부터 쏟아져 나와 당혹스러웠다.

    결국 하이퍼플레인은 차원에 따라 데이터를 분류하는 기준선으로 직관적으로 이해하고 넘어갔으며 깊은 수학적 증명은 추후 필요할 때 다시 찾아보는 방향으로 학습을 마무리했다.

    2. 회귀분석 핵심 정리

    관계와 상관계수

    • 상관관계: 독립변수와 종속변수가 함께 변하는 경향성
    • 인과관계: 독립변수가 원인이 되어 종속변수라는 결과를 일으키는 명확한 관계
    • 스피어만 상관계수: 데이터의 순위를 기반으로 비선형적이거나 서열적인 관계 측정
    • 피어슨 상관계수: 두 변수 간의 선형적인 관계 강도 측정

    회귀 분석의 기초

    • 회귀분석: 독립변수를 통해 종속변수를 예측하거나 관계를 모델링하는 방법
    • 최소제곱법: 예측선과 실제값 사이의 잔차 제곱합을 최소로 만들어 최적의 가중치를 찾는 방법
    • 오차: 모집단에서 실제값과 이론적인 회귀선 사이의 차이
    • 잔차: 표본 데이터에서 실제값과 모델이 예측한 값의 차이
    • 결정계수: 모델의 설명력을 나타내며 전체 변동 중 모델이 설명하는 변동의 비율

    규제 모델

    • 벌점 회귀: 가중치의 크기를 제한하여 모델의 과적합을 방지
    • L1 규제 라쏘: 중요하지 않은 변수의 가중치를 0으로 만들어 변수 선택 효과가 있음
    • L2 규제 릿지: 가중치를 전체적으로 작게 만들지만 0으로 만들지는 않아 다중공선성 해결에 유리함

    3. 머신러닝 및 분류 모델 핵심 정리

    머신러닝 기초 개념

    • 방법론 유형: 지도학습 비지도학습 강화학습
    • 지도학습 모델: KNN 의사결정나무 SVM 등

    분류 문제 평가 지표

    • 혼동행렬: 예측값과 실제값을 4가지 기준으로 비교하는 지표
    • 정확도: 전체 예측 중 실제로 맞춘 비율
    • 오분류율: 전체 예측 중 틀린 비율
    • 민감도 재현율: 실제 참인 데이터 중 모델이 참으로 예측한 비율
    • 특이도: 실제 거짓인 데이터 중 모델이 거짓으로 예측한 비율
    • ROC 곡선: 모든 임계값을 고려한 분류 성능 지표
    • AUC: ROC 곡선 아래의 면적을 수치화한 데이터

    변수 표준화와 정규화

    • 표준화: 변수를 평균에서 빼고 표준편차로 나누어 평균 0 표준편차 1로 만드는 과정 주로 거리 기반 알고리즘에 사용
    • 정규화: 최솟값과 최댓값을 이용해 데이터를 0과 1 사이의 범위로 압축하는 과정

    주요 알고리즘 요약

    • KNN: 새로운 데이터와 가장 가까운 K개의 이웃을 찾아 다수결로 분류하는 알고리즘
    • SVM: 분류 기준선인 하이퍼플레인을 긋고 서포트 벡터와의 마진을 최대화하여 과적합을 방지하는 알고리즘
    • 커널 트릭: 비선형 데이터를 분류하기 위해 적은 연산량으로 차원을 높여 계산하는 기법
    • 의사결정나무: 불순도를 줄이는 방향으로 여러 개의 경계선을 만들어 데이터를 분류하며 이진 분류와 다중 분류에 모두 사용됨
    • 나이브 베이즈: 변수들이 서로 독립적이라는 가정하에 베이즈 정리를 활용하여 새로운 증거 데이터 가 주어졌을 때 가설의 확률을 업데이트하는 방법

    로지스틱 회귀와 확률 추정

    • 로지스틱 회귀: 분류 문제에 대해 시그모이드 함수를 사용하여 0 또는 1 사이의 확률값으로 결과를 출력하는 모델
    • 오즈: 실패 확률 대비 성공 확률의 비율
    • 최대우도추정법 MLE: 관측된 결과가 일어날 가능성을 가장 높게 만드는 최적의 파라미터를 찾는 방법
    • 최대사후확률 MAP: 사람의 사전 지식과 관측 데이터를 조합하여 최종 결과를 추정하는 방법

    댓글

Designed by Tistory.