5-2. CNN 주요 구조: LeNet, AlexNet, VGGNet 비교 분석
1. CNN(Convolutional Neural Network)의 이해: 이미지 인식의 혁신
이미지 인식 분야에서 딥러닝 기술은 혁신적인 발전을 이루었습니다. 그 중심에는 CNN(Convolutional Neural Network)이 자리 잡고 있으며, 특히 LeNet, AlexNet, VGGNet은 CNN의 기본적인 구조를 확립하고 성능을 크게 향상시킨 중요한 모델들입니다. CNN은 기존의 신경망과 달리 이미지의 특징을 효과적으로 추출하기 위한 특수한 구조를 가지고 있습니다. 이 글에서는 CNN의 기본적인 개념과 더불어, 세 모델의 특징을 비교 분석하며 이미지 인식 분야의 발전을 살펴보겠습니다.
1) CNN의 기본 개념
CNN은 Convolutional Layer(합성곱층), Pooling Layer(풀링층), Fully Connected Layer(완전 연결층)의 세 가지 주요 레이어로 구성됩니다. CNN은 이미지의 공간적 계층 구조를 학습하는 데 특화되어 있습니다.

CNN의 작동 원리를 쉽게 이해하기 위해 비유를 들어보겠습니다. 마치 사람이 이미지를 인식하는 과정과 유사합니다.
사람이 이미지를 볼 때, 처음에는 전체적인 형태를 파악하고, 세부적인 특징을 차례로 인지합니다. 예를 들어, 고양이를 인식할 때, 눈, 코, 입, 귀와 같은 특징들을 개별적으로 파악한 후, 이러한 특징들을 조합하여 고양이임을 판단합니다.
CNN도 마찬가지입니다.
- Convolutional Layer: 이미지의 특징을 추출하는 필터(filter)를 사용합니다. 각 필터는 이미지의 작은 영역을 스캔하며 특정 패턴(예: 모서리, 질감)을 감지합니다. 이 과정에서 특징 맵(feature map)이 생성됩니다.
- Pooling Layer: 특징 맵의 크기를 줄이고, 중요한 특징을 강조합니다. 최대 풀링(max pooling)은 특정 영역에서 가장 큰 값을 선택하여 특징을 추출합니다.
- Fully Connected Layer: 앞선 레이어에서 추출된 특징들을 종합하여 최종적인 분류를 수행합니다.
이러한 레이어들을 조합하여 CNN은 이미지의 복잡한 특징을 효과적으로 학습하고 인식할 수 있습니다.
2) CNN의 장점
CNN은 다음과 같은 장점을 가지고 있습니다.
- 지역 연결성(Local Connectivity): 각 뉴런이 전체 이미지가 아닌 일부 영역에만 연결되어 있어, 파라미터 수를 줄이고 계산 효율성을 높입니다.
- 가중치 공유(Weight Sharing): 동일한 필터가 이미지 전체에 걸쳐 사용되어, 특징 추출을 위한 학습 파라미터의 수를 더욱 감소시킵니다.
- 변환 불변성(Translation Invariance): 이미지 내에서 객체의 위치가 변경되어도 동일한 특징을 감지할 수 있습니다.
2. LeNet: CNN의 시초
LeNet은 1998년 Yann LeCun에 의해 제안된 CNN의 초기 모델입니다. 이 모델은 손글씨 숫자 인식 문제(MNIST)를 해결하기 위해 설계되었으며, CNN의 기본적인 구조를 제시했습니다.
1) LeNet의 구조
LeNet의 구조는 다음과 같습니다.
- 입력: 32x32 픽셀의 흑백 이미지
- Convolutional Layer: 6개의 5x5 필터를 사용하여 특징 맵을 생성
- Pooling Layer: 2x2 풀링을 사용하여 특징 맵의 크기를 줄임
- Convolutional Layer: 16개의 5x5 필터를 사용하여 특징 맵을 생성
- Pooling Layer: 2x2 풀링을 사용하여 특징 맵의 크기를 줄임
- Fully Connected Layer: 120개의 뉴런
- Fully Connected Layer: 84개의 뉴런
- Output Layer: 10개의 뉴런(0~9까지의 숫자)

LeNet은 당시로서는 획기적인 모델이었으며, 이미지 인식 분야에 CNN의 가능성을 제시했습니다.
2) LeNet의 특징
합성곱(Convolution)과풀링(Pooling)레이어를 결합하여 이미지의 특징을 효과적으로 추출- 지역 연결성과 가중치 공유 개념을 통해 파라미터 수를 줄이고 계산 효율성을 높임
- MNIST 데이터셋에서 높은 인식 정확도를 달성
3. AlexNet: CNN의 부활
AlexNet은 2012년 ImageNet Large Scale Visual Recognition Challenge (ILSVRC)에서 압도적인 성능으로 우승하면서, 딥러닝과 CNN의 부흥을 이끈 모델입니다.
1) AlexNet의 구조
AlexNet은 LeNet보다 훨씬 깊고 복잡한 구조를 가지고 있습니다.
- 입력: 227x227 픽셀의 RGB 이미지
- Convolutional Layer: 96개의 11x11 필터
- Pooling Layer: 3x3 풀링
- Convolutional Layer: 256개의 5x5 필터
- Pooling Layer: 3x3 풀링
- Convolutional Layer: 384개의 3x3 필터
- Convolutional Layer: 384개의 3x3 필터
- Convolutional Layer: 256개의 3x3 필터
- Pooling Layer: 3x3 풀링
- Fully Connected Layer: 4096개의 뉴런
- Fully Connected Layer: 4096개의 뉴런
- Output Layer: 1000개의 뉴런(ImageNet의 1000개 클래스)

AlexNet은 GPU를 활용한 병렬 처리를 통해 학습 속도를 높였으며, 대용량 데이터셋(ImageNet)을 효과적으로 학습할 수 있도록 설계되었습니다.
2) AlexNet의 특징
- ReLU 활성화 함수: 기존의 시그모이드 함수보다 학습 속도를 개선
- Dropout 정규화: 과적합(overfitting)을 방지
- Data Augmentation: 데이터셋의 크기를 늘리고 모델의 일반화 성능을 향상
- GPU를 활용한 병렬 처리
AlexNet은 이러한 특징들을 통해 이미지 인식 분야에서 획기적인 성능 향상을 이끌어냈습니다.
4. VGGNet: 깊이를 더하다
VGGNet은 2014년 ILSVRC에서 준우승을 차지한 모델로, AlexNet보다 더 깊은 구조를 통해 성능을 향상시켰습니다.
1) VGGNet의 구조
VGGNet은 다양한 깊이의 모델을 제공하며, VGG16과 VGG19가 대표적입니다. VGGNet의 핵심은 작은 크기의 필터(3x3)를 사용하고, 여러 개의 레이어를 쌓아 깊이를 깊게 한 것입니다.

VGGNet은 3x3 필터를 사용하여 파라미터 수를 줄이고, 깊은 레이어를 통해 더욱 복잡한 특징을 학습할 수 있게 했습니다.
2) VGGNet의 특징
- 3x3 합성곱 필터: 파라미터 수를 줄이고, 깊은 레이어를 쌓을 수 있도록 함
- 여러 개의 합성곱 레이어: 이미지의 특징을 더욱 효과적으로 추출
- 균일한 구조: 동일한 크기의 필터와 풀링 레이어를 반복 사용
VGGNet은 깊은 구조를 통해 이미지 인식 성능을 향상시켰으며, 이후 많은 CNN 모델의 기반이 되었습니다.
5. LeNet, AlexNet, VGGNet 비교
세 모델의 특징을 비교하면 다음과 같습니다.
| 특징 | LeNet | AlexNet | VGGNet |
|---|---|---|---|
| 구조 깊이 | 얕음 | 중간 | 깊음 |
| 필터 크기 | 5x5 | 11x11, 5x5, 3x3 | 3x3 |
| 활성화 함수 | 시그모이드 | ReLU | ReLU |
| 데이터셋 | MNIST | ImageNet | ImageNet |
| 주요 특징 | CNN의 기본 구조 제시 | GPU 활용, Dropout, Data Augmentation | 3x3 필터, 깊은 구조 |
| 성능 | MNIST에서 높은 정확도 | ImageNet에서 획기적인 성능 향상 | ImageNet에서 AlexNet보다 높은 성능 |
이 표를 통해 각 모델의 차이점과 발전 과정을 한눈에 파악할 수 있습니다.
6. 결론
LeNet, AlexNet, VGGNet은 CNN의 발전 과정에서 중요한 역할을 한 모델들입니다. LeNet은 CNN의 기본 구조를 제시하고, AlexNet은 GPU를 활용한 학습과 다양한 기법을 통해 성능을 크게 향상시켰습니다. VGGNet은 깊은 구조를 통해 이미지 인식 분야의 발전을 더욱 가속화했습니다.
이러한 모델들은 현재까지도 딥러닝 연구의 중요한 기반이 되며, 새로운 CNN 모델 개발에 영감을 주고 있습니다. 앞으로도 CNN은 이미지 인식뿐만 아니라 다양한 분야에서 활용될 것으로 기대됩니다.
비슷한 글 추천
6-2. CNN: LeNet, AlexNet
LeNet, AlexNet 구조, 이미지 분류
5-6. 최신 CNN 아키텍처: ResNet, Inception, EfficientNet
ResNet, Inception, EfficientNet 등 최신 CNN 아키텍처의 특징과 성능을 비교 분석하고, 발전 방향을 제시합니다.
1-4. 딥러닝의 주요 응용 분야: 이미지, 음성, 자연어 처리
딥러닝이 활발하게 활용되는 주요 분야(이미지 인식, 음성 인식, 자연어 처리)의 대표적인 사례를 소개합니다.
5-1. 합성곱 신경망 (CNN) 기초: Convolution, Pooling
--- title: "date: 2026-01-06" category: '' tags: [] summary: --- 1. 합성곱 신경망(CNN)의 등장 배경 이미지, 비디오, 음성 등 다양한 형태의 데이터를 다루는 딥러닝 모델 중, 특히 이미지 인식 분야에서...
Comments (0)
No comments yet. Be the first to comment!
Please to write a comment.