인공지능(AI) 모델 종류 및 상세 설명
1. 머신러닝(Machine Learning) 모델
지도학습(Supervised Learning)
| 모델 |
특징 |
용도 |
| 선형 회귀(Linear Regression) |
연속값 예측, 단순한 관계 모델링 |
주가 예측, 회귀 분석 |
| 로지스틱 회귀(Logistic Regression) |
이진 분류, 확률 출력 |
스팸 감지, 의료 진단 |
| 결정 트리(Decision Tree) |
규칙 기반 분할, 해석 용이 |
고객 분류, 리스크 평가 |
| 랜덤 포레스트(Random Forest) |
앙상블 기반, 과적합 방지 |
특성 중요도 분석 |
| SVM(Support Vector Machine) |
최적 경계선 탐색 |
이미지 분류, 텍스트 분류 |
| K-최근접 이웃(KNN) |
유사 데이터 기반 예측 |
추천 시스템, 패턴 인식 |
비지도학습(Unsupervised Learning)
| 모델 |
특징 |
용도 |
| K-평균(K-Means) |
클러스터링, 그룹화 |
고객 세그먼테이션 |
| DBSCAN |
밀도 기반 클러스터링 |
이상 감지 |
| PCA(주성분 분석) |
차원 축소 |
데이터 시각화, 노이즈 제거 |
| GMM(가우시안 혼합 모델) |
확률 기반 클러스터링 |
음성 인식 |
2. 딥러닝(Deep Learning) 모델
합성곱 신경망 (CNN)
용도: 이미지 처리, 컴퓨터 비전
| 모델 |
특징 |
주요 성과 |
| LeNet |
초기 CNN, 손글씨 인식 |
우편 번호 인식 |
| AlexNet |
깊은 구조, ReLU 활성화 |
ImageNet 우승 |
| VGGNet |
3x3 커널 통일, 깊은 구조 |
이미지 분류 |
| GoogLeNet/Inception |
인셉션 모듈, 1x1 컨볼루션 |
이미지 분류 |
| ResNet |
잔차 연결, 매우 깊은 구조 |
152+ 레이어 |
| EfficientNet |
축척 최적화, 효율적 |
성능/속도 균형 |
| YOLO |
실시간 객체 감지 |
자율주행, 감시 |
| U-Net |
이미지 분할, 의료 영상 |
종양 감지 |
순환 신경망 (RNN)
용도: 시계열 데이터, 자연어 처리
| 모델 |
특징 |
용도 |
| Basic RNN |
기본 순환 구조 |
시계열 예측 |
| LSTM(Long Short-Term Memory) |
장기 의존성 처리 |
기계 번역, 음성 인식 |
| GRU(Gated Recurrent Unit) |
LSTM 경량화 |
텍스트 생성 |
| Bi-directional RNN |
양방향 처리 |
감정 분석 |
트랜스포머 (Transformer)
용도: 자연어 처리, 최신 AI의 핵심
트랜스포머 구조:
├── 인코더 (Encoder)
│ ├── 셀프 어텐션 (Self-Attention)
│ └── 피드포워드 네트워크
└── 디코더 (Decoder)
├── 마스크드 셀프 어텐션
├── 인코더-디코더 어텐션
└── 피드포워드 네트워크
| 모델 |
특징 |
용도 |
| BERT |
양방향 사전 학습 |
질의응답, 감정 분석 |
| GPT 시리즈 |
생성형 언어 모델 |
텍스트 생성, 대화 |
| T5 |
텍스트 변환 |
번역, 요약 |
| Vision Transformer(ViT) |
이미지에 트랜스포머 적용 |
이미지 분류 |
| CLIP |
이미지-텍스트 대조 학습 |
멀티모달 AI |
| Whisper |
음성 인식 |
자동 자막 |
3. 생성 모델 (Generative Models)
| 모델 |
특징 |
용도 |
| GAN(적대적 생성 네트워크) |
생성기 vs 판별기 경쟁 |
이미지 생성, 스타일 전이 |
| VAE(변분 오토인코더) |
확률적 잠재 공간 |
이미지 생성, 이상 감지 |
| Diffusion Model |
노이즈 제거 과정 |
DALL-E, Stable Diffusion |
| Flow-based Model |
가역적 변환 |
고품질 이미지 생성 |
4. 강화학습 (Reinforcement Learning) 모델
| 모델 |
특징 |
용도 |
| Q-Learning |
테이블 기반 가치 함수 |
게임 AI |
| DQN(Deep Q-Network) |
딥러닝 + Q-Learning |
Atari 게임 |
| Policy Gradient |
정책 직접 학습 |
로봇 제어 |
| Actor-Critic |
가치/정책 하이브리드 |
자율주행 |
| PPO(Proximal Policy Optimization) |
안정적 정책 업데이트 |
ChatGPT RLHF |
| AlphaGo/AlphaZero |
몬테카를로 트리 탐색 |
바둑, 체스 |
5. 특수 목적 모델
컴퓨터 비전
- Faster R-CNN: 객체 감지
- Mask R-CNN: 인스턴스 분할
- DeepLab: 시맨틱 분할
- PoseNet: 자세 추정
자연어 처리
- Word2Vec: 단어 임베딩
- FastText: 서브워드 임베딩
- ELMo: 문맥적 임베딩
오디오/음성
- WaveNet: 음성 합성
- DeepSpeech: 음성 인식
- Jukebox: 음악 생성
6. 최신 트렌드 (2024-2025)
파운데이션 모델 (Foundation Models)
- 대규모 언어 모델(LLM): GPT-4, Claude, Gemini
- 멀티모달 모델: 이미지+텍스트+오디오 통합
- 비전-언어 모델: CLIP, DALL-E
경량화 및 엣지 AI
- 모델 압축: 양자화, 프루닝
- 지식 증류: 작은 모델로 큰 모델 학습
- 모바일 배포: TensorFlow Lite, Core ML
AutoML
- NAS(Neural Architecture Search): 아키텍처 자동 설계
- 하이퍼파라미터 최적화: Optuna, Ray Tune
7. 모델 선택 기준
- 데이터 유형: 이미지, 텍스트, 시계열, 구조화 데이터
- 과제 유형: 분류, 회귀, 생성, 추천
- 자원 제한: GPU 메모리, 학습 시간
- 해석 가능성: 의사결정 프로세스 설명 필요성
- 실시간성: 추론 속도 요구사항
각 모델은 특정 문제에 최적화되어 있으며, 문제의 특성과 요구사항에 따라 적절한 모델을 선택하는 것이 중요합니다.