-
[메타코드 AI LLM 부트캠프] 4주차 학습 일지: 6주차 딥러닝 과제 & 4주차 머신러닝 분류 학습공부/메타코드 LLM 부트캠프 2026. 3. 9. 13:47
1. 주간 학습 회고
이번 주는 지난주에 이어 6주 차 과제물 제출과 밀려있던 4주 차 강의 학습을 진행습니다.
중간에 장례 일정이 있어 하루 정도 학습을 진행하지 못했고 과제물의 양도 생각보다 많아 완료까지 4일이 걸렸습니다.
하나씩 차근차근 해결하며 과제를 무사히 제출한 뒤 남은 금 토 일요일 동안 4주 차 강의를 수강했습니다
4주 차 강의는 회귀분석과 머신러닝의 지도학습 분류 문제 등을 다루었으며 분량이 약 20시간에 달해 걱정이 앞습니다.
하지만 이론 실습 심화이론 실습으로 이어지는 반복적인 커리큘럼 덕분에 공통된 내용을 여러 번 점검하며
수월하게 이해도를 높일 수 있습니다.
다만 머신러닝 분류 심화 부분에서 아쉬움이 남았습니다.
이론과 수학적 증명에만 치우친 설명 탓에 개발자 입장에서는 이것이 왜 필요한지 어떻게 쓰이는지에 대한 맥락을 잡기 어려웠다. 예를 들어 하이퍼플레인을 설명할 때 p 차원에서의 하이퍼플레인은 p-1 차원에서의 평평한 어핀 공간이라는 수학적 정의와 수식부터 쏟아져 나와 당혹스러웠다.
결국 하이퍼플레인은 차원에 따라 데이터를 분류하는 기준선으로 직관적으로 이해하고 넘어갔으며 깊은 수학적 증명은 추후 필요할 때 다시 찾아보는 방향으로 학습을 마무리했다.
2. 회귀분석 핵심 정리
관계와 상관계수
- 상관관계: 독립변수와 종속변수가 함께 변하는 경향성
- 인과관계: 독립변수가 원인이 되어 종속변수라는 결과를 일으키는 명확한 관계
- 스피어만 상관계수: 데이터의 순위를 기반으로 비선형적이거나 서열적인 관계 측정
- 피어슨 상관계수: 두 변수 간의 선형적인 관계 강도 측정
회귀 분석의 기초
- 회귀분석: 독립변수를 통해 종속변수를 예측하거나 관계를 모델링하는 방법
- 최소제곱법: 예측선과 실제값 사이의 잔차 제곱합을 최소로 만들어 최적의 가중치를 찾는 방법
- 오차: 모집단에서 실제값과 이론적인 회귀선 사이의 차이
- 잔차: 표본 데이터에서 실제값과 모델이 예측한 값의 차이
- 결정계수: 모델의 설명력을 나타내며 전체 변동 중 모델이 설명하는 변동의 비율
규제 모델
- 벌점 회귀: 가중치의 크기를 제한하여 모델의 과적합을 방지
- L1 규제 라쏘: 중요하지 않은 변수의 가중치를 0으로 만들어 변수 선택 효과가 있음
- L2 규제 릿지: 가중치를 전체적으로 작게 만들지만 0으로 만들지는 않아 다중공선성 해결에 유리함
3. 머신러닝 및 분류 모델 핵심 정리
머신러닝 기초 개념
- 방법론 유형: 지도학습 비지도학습 강화학습
- 지도학습 모델: KNN 의사결정나무 SVM 등
분류 문제 평가 지표
- 혼동행렬: 예측값과 실제값을 4가지 기준으로 비교하는 지표
- 정확도: 전체 예측 중 실제로 맞춘 비율
- 오분류율: 전체 예측 중 틀린 비율
- 민감도 재현율: 실제 참인 데이터 중 모델이 참으로 예측한 비율
- 특이도: 실제 거짓인 데이터 중 모델이 거짓으로 예측한 비율
- ROC 곡선: 모든 임계값을 고려한 분류 성능 지표
- AUC: ROC 곡선 아래의 면적을 수치화한 데이터
변수 표준화와 정규화
- 표준화: 변수를 평균에서 빼고 표준편차로 나누어 평균 0 표준편차 1로 만드는 과정 주로 거리 기반 알고리즘에 사용
- 정규화: 최솟값과 최댓값을 이용해 데이터를 0과 1 사이의 범위로 압축하는 과정
주요 알고리즘 요약
- KNN: 새로운 데이터와 가장 가까운 K개의 이웃을 찾아 다수결로 분류하는 알고리즘
- SVM: 분류 기준선인 하이퍼플레인을 긋고 서포트 벡터와의 마진을 최대화하여 과적합을 방지하는 알고리즘
- 커널 트릭: 비선형 데이터를 분류하기 위해 적은 연산량으로 차원을 높여 계산하는 기법
- 의사결정나무: 불순도를 줄이는 방향으로 여러 개의 경계선을 만들어 데이터를 분류하며 이진 분류와 다중 분류에 모두 사용됨
- 나이브 베이즈: 변수들이 서로 독립적이라는 가정하에 베이즈 정리를 활용하여 새로운 증거 데이터 가 주어졌을 때 가설의 확률을 업데이트하는 방법
로지스틱 회귀와 확률 추정
- 로지스틱 회귀: 분류 문제에 대해 시그모이드 함수를 사용하여 0 또는 1 사이의 확률값으로 결과를 출력하는 모델
- 오즈: 실패 확률 대비 성공 확률의 비율
- 최대우도추정법 MLE: 관측된 결과가 일어날 가능성을 가장 높게 만드는 최적의 파라미터를 찾는 방법
- 최대사후확률 MAP: 사람의 사전 지식과 관측 데이터를 조합하여 최종 결과를 추정하는 방법
'공부 > 메타코드 LLM 부트캠프' 카테고리의 다른 글