AI와 개발을 쉽게 이해하는 실험실

비개발자도 따라오는 AI 도구, 자동화, 개발 실험 기록

AI & LLM/AI 도구 리뷰

DeepFaceLab 사용법 한국어 가이드 — 설치부터 결과물까지

루민 Lumin 2026. 5. 23. 22:15
반응형
DeepFaceLab 사용법을 비개발자도 따라할 수 있게 한국어로 정리했습니다. 설치 준비물부터 모델 학습, 최종 영상 추출까지 전체 흐름과 자주 막히는 지점, GPU 사양 기준을 함께 다룹니다.

딥페이크라는 단어는 익숙한데, 막상 직접 만들어 보려고 하면 어디서부터 시작해야 할지 막막합니다. 저도 처음엔 그랬습니다. DeepFaceLab은 그 분야에서 가장 널리 쓰이는 무료 오픈소스 도구인데, 자료가 대부분 영어라 비개발자 분들이 입문하기 쉽지 않습니다. 이 글은 그 진입장벽을 낮추기 위해, 제가 직접 한 번 굴려본 흐름을 한국어로 단계별로 풀어 정리한 가이드입니다. 코드를 짜본 적 없어도 따라올 수 있게 용어는 그때그때 풀어 쓰겠습니다.

다만 미리 말씀드리면, 이 도구는 가볍지 않습니다. 그래픽카드(GPU)가 어느 정도 받쳐줘야 하고, 학습에 길게는 며칠이 걸립니다. 그 현실까지 솔직하게 다루겠습니다.

DeepFaceLab이 뭐길래

DeepFaceLab은 영상 속 인물의 얼굴을 다른 사람의 얼굴로 바꿔주는 오픈소스 딥페이크 제작 도구입니다. 2018년 공개 이후 영화 VFX 업계와 유튜브 패러디 영상에서 널리 쓰여 왔고, 공식 GitHub 소개에 따르면 시중에 공개된 딥페이크 영상의 상당수가 이 도구로 만들어졌다고 합니다.

작동 원리를 아주 단순하게 설명하면 이렇습니다. AI에게 "A의 얼굴 사진 수천 장"과 "B의 얼굴 사진 수천 장"을 보여주고, 두 얼굴을 서로 변환하는 법을 학습시킵니다. 학습이 끝나면 A가 등장하는 영상에 B의 얼굴을 자연스럽게 덮어씌울 수 있게 됩니다.

항목 내용
공식 사이트 github.com/iperov/DeepFaceLab
라이선스 GPL-3.0 (무료, 비상업/상업 모두 가능)
지원 OS Windows 10/11 (공식 빌드), Linux (커뮤니티 빌드)
권장 GPU NVIDIA RTX 시리즈, VRAM 8GB 이상
평균 작업 시간 짧은 클립 기준 12~48시간
⚠️ 시작 전에 꼭 짚고 갑니다. 실존 인물의 얼굴을 본인 동의 없이 합성해 배포하는 것은 한국에서 성폭력처벌법상 처벌 대상입니다(허위영상물 제작·반포). 이 글은 본인 얼굴 실험, 영화·VFX 학습, 연구 목적을 전제로 합니다.

시작 전 준비물 체크

본격 설치 전에 한 번에 확인하면 좋은 항목들을 모았습니다. 여기서 막히면 뒤에서도 계속 막히기 때문에, 미리 점검하는 편이 빠릅니다.

- [ ] Windows 10 또는 11 (64비트)
- [ ] NVIDIA 그래픽카드 (GTX 1060 이상, RTX 3060 이상 권장)
- [ ] VRAM 8GB 이상 (GPU 메모리)
- [ ] 저장공간 50GB 이상 여유
- [ ] 최신 NVIDIA 드라이버 설치
- [ ] 작업할 원본 영상(SRC, DST) 각 1개씩

용어를 잠깐 풀자면, VRAM은 그래픽카드 자체에 달린 메모리입니다. 일반 RAM과는 별개고, AI가 그림을 학습할 때 이 공간을 씁니다. 작업관리자의 "성능" 탭에서 GPU를 누르면 "전용 GPU 메모리" 항목으로 확인할 수 있습니다.

SRC(소스)DST(목적지)는 DeepFaceLab에서 계속 등장하는 단어입니다. SRC는 "이 얼굴을 가져올 사람"의 영상, DST는 "이 영상에 얹을 거야"라는 대상 영상입니다. 예를 들어 본인 얼굴(SRC)을 영화 한 장면(DST)에 넣고 싶다면, 본인 얼굴이 잘 보이는 영상이 SRC고 영화 클립이 DST입니다.

SRC 영상 (얼굴 제공자)  ┐
                       ├→ AI 학습 →  결과 영상
DST 영상 (배경 제공자)  ┘            (DST 배경 + SRC 얼굴)

Mac이나 AMD 그래픽카드 사용자는 공식 빌드를 쓸 수 없습니다. 글 작성 시점 기준 공식 배포판은 NVIDIA CUDA를 전제로 만들어졌고, 가장 안정적입니다. AMD 사용자는 DirectX 12 빌드라는 비공식 버전이 있지만 호환성 이슈가 잦습니다.

설치하기 — 압축만 풀면 끝

DeepFaceLab은 일반 프로그램과 달리 "설치 파일"이 아닌 포터블(압축 해제 방식)로 배포됩니다. 즉, 설치 마법사를 클릭클릭하는 게 아니라 압축 폴더 하나를 통째로 받아서 적당한 위치에 풀면 그게 설치 끝입니다.

순서는 이렇습니다.

  1. 공식 GitHub 페이지(github.com/iperov/DeepFaceLab)에서 "Releases" 또는 본문 링크의 MEGA 다운로드 링크로 이동합니다.
  2. 본인 GPU에 맞는 빌드를 선택합니다. RTX 30/40 시리즈는 DeepFaceLab_NVIDIA_RTX3000_series_build, 그 이전 카드는 DeepFaceLab_NVIDIA_up_to_RTX2080Ti_build를 받습니다.
  3. 다운로드한 .exe 파일은 자동 압축 해제 파일입니다. 더블클릭하면 폴더 하나가 만들어집니다. 경로에 한글이 절대 들어가지 않게 합니다. C:\DeepFaceLab\ 같은 단순한 위치가 가장 안전합니다.
💡 한글 경로(C:\사용자\철수\바탕화면\ 등)에 두면 학습 단계에서 알 수 없는 에러가 납니다. 제가 처음 한 시간 날린 이유가 정확히 이거였습니다.

압축을 풀면 폴더 안에 _internal, workspace, 그리고 번호로 시작하는 배치 파일들(1) clear workspace.bat, 2) extract images from video data_src.bat 같은)이 잔뜩 보입니다. 이 배치 파일들이 우리가 앞으로 더블클릭으로 실행하게 될 "버튼"들입니다. 코드를 입력할 일은 거의 없습니다.

작업 흐름 한눈에 보기

DeepFaceLab의 전체 과정은 크게 5단계입니다. 각 단계가 어떤 배치 파일에 대응되는지 표로 정리했습니다.

단계 하는 일 실행할 파일 (대표)
1. 영상 넣기 SRC/DST 영상을 workspace 폴더에 복사 (수동 복사)
2. 프레임 추출 영상을 사진 한 장씩으로 쪼갬 2) extract images from video data_src
3. 얼굴 추출 사진에서 얼굴 영역만 잘라냄 4) data_src faceset extract
4. 모델 학습 AI가 두 얼굴 변환을 학습 6) train SAEHD
5. 영상 합성 학습된 결과로 최종 영상 생성 7) merge SAEHD + 8) merged to mp4

처음엔 파일 이름의 숫자 순서를 그대로 따라가면 됩니다. 1번부터 8번까지 차례로 누르면 끝나는 구조라 제작자가 친절하게 설계해 둔 셈입니다.

영상 → [프레임 추출] → 사진 수천 장
사진 → [얼굴 검출]   → 얼굴만 잘린 사진들
얼굴 → [모델 학습]   → 변환 규칙 학습 (오래 걸림)
학습 → [합성/병합]   → 최종 mp4

핵심 단계 — 얼굴 추출과 학습

가장 시간이 오래 걸리고 결과 품질을 좌우하는 두 단계입니다.

얼굴 추출은 추출된 프레임 사진에서 얼굴만 골라 정렬하는 과정입니다. 4) data_src faceset extract.bat을 더블클릭하면 검은 창(터미널)이 뜨고 몇 가지 질문을 합니다. 검은 창은 컴퓨터에게 직접 명령을 주는 창구라고 보시면 됩니다. 대부분 질문은 그냥 Enter를 눌러 기본값을 쓰면 됩니다.

Face type ( f / wf / head ?:help ) : wf

위 같은 질문이 나오면 wf를 입력하고 Enter를 칩니다. wf는 whole face로, 이마와 턱까지 포함한 넓은 영역을 잡아 자연스러운 결과를 냅니다.

추출이 끝나면 workspace\data_src\aligned\ 폴더에 얼굴 사진이 쭉 들어갑니다. 여기서 수동으로 잘못 잡힌 얼굴을 지우는 작업이 정말 중요합니다. 옆모습이 너무 심하거나, 다른 사람 얼굴이 섞였거나, 흐릿한 사진을 빼야 합니다. 이걸 안 하면 결과물 품질이 확 떨어집니다. 영상 1분 분량(약 1,500~1,800장)을 정리하는 데 15~30분쯤 잡으시면 됩니다.

모델 학습6) train SAEHD.bat으로 시작합니다. SAEHD는 DeepFaceLab의 대표 모델 종류 중 하나로, 품질과 속도의 균형이 좋아 가장 많이 쓰입니다. 처음 실행하면 모델 이름과 해상도, 배치 크기 등을 묻습니다.

옵션 추천값 (RTX 3060 8GB 기준) 설명
Resolution 192 결과물 해상도, 높을수록 선명하지만 느림
Face type wf 위에서 wf로 추출했다면 동일하게
Batch size 4~6 VRAM 부족하면 낮춤
Models optimizer on GPU Yes GPU 메모리 충분하면 Yes

학습이 시작되면 작은 미리보기 창이 뜹니다. 가운데 두 줄이 SRC와 DST의 변환 결과인데, 처음엔 흐릿한 덩어리지만 시간이 지날수록 또렷해집니다. 이 단계는 짧으면 12시간, 길면 며칠이 걸립니다. 컴퓨터를 다른 일에 쓰기 어려우니 잠자기 전에 돌리거나 별도 PC를 두는 분이 많습니다.

학습을 멈추고 싶으면 미리보기 창에서 Enter를 누릅니다. 진행 상황은 자동 저장되니 다음에 같은 파일을 다시 실행하면 이어서 학습합니다.

💡 미리보기 손실값(loss)이 0.2 아래로 내려가고 더 안 떨어지면 학습 종료 신호로 봅니다. 다만 숫자보다 미리보기 화면이 자연스러워 보이는지가 더 중요합니다.

자주 막히는 부분

제가 직접 부딪혔거나, 커뮤니티 후기에 자주 올라오는 문제들입니다.

"OOM(Out of Memory) 에러가 떠요" — VRAM이 부족하다는 뜻입니다. 학습 시작 시 batch size를 2까지 낮추고, resolution도 128로 내려보세요. 그래도 안 되면 GPU 사양 문제라 클라우드 GPU(예: vast.ai, RunPod) 대여를 고려해야 합니다. 시간당 0.3~1달러 수준입니다(글 작성 시점 기준).

"학습은 되는데 결과가 어색해요" — 99% SRC 데이터셋 문제입니다. 얼굴 각도가 다양한지, 조명이 비슷한지, 사진 수가 충분한지(최소 2,000장 권장) 확인하세요. DST와 비슷한 각도·조명의 SRC 사진이 많을수록 자연스러워집니다.

"미리보기 창이 까맣게 뜨거나 멈춰요" — NVIDIA 드라이버를 최신으로 업데이트하고, 다른 GPU 사용 프로그램(게임, 영상편집기, 브라우저 가속)을 모두 끕니다. 윈도우 재부팅 후 다시 시도하면 80%는 풀립니다.

"한글 경로 에러" — 위에서도 말씀드렸지만, 작업 폴더 경로 어디에도 한글이 없어야 합니다. 사용자 이름이 한글이면 사용자 폴더 자체를 피해 C:\ 바로 밑에 두세요.

합성 단계와 결과물 추출

학습이 끝났다면 마지막은 비교적 간단합니다. 7) merge SAEHD.bat을 실행하면 학습된 모델로 DST 영상의 각 프레임에 SRC 얼굴을 입히는 작업이 진행됩니다. 여기서도 몇 가지 옵션을 물어보는데, 처음이라면 Interactive Merger(대화형 병합) 모드를 선택하세요. 키보드로 결과를 미리 보면서 마스크 크기, 색감 보정 같은 걸 실시간으로 조정할 수 있습니다.

마지막으로 8) merged to mp4.bat을 실행하면 합성된 프레임들이 하나의 mp4 동영상으로 합쳐집니다. 결과물은 workspace\result.mp4에 저장됩니다.

처음 결과물은 솔직히 만족스럽지 않을 가능성이 높습니다. 경계가 보이거나, 색이 안 맞거나, 표정이 어색합니다. 이때부터가 진짜 시작입니다. SRC 데이터셋을 보강하고, 학습을 더 길게 돌리고, 마스크 옵션을 조정하면서 점차 다듬는 과정이 필요합니다. 영상 VFX 작업자들이 한 클립에 며칠씩 쓰는 데는 이유가 있습니다.

마무리

DeepFaceLab은 무료라는 장점은 분명하지만, 진입장벽이 낮은 도구는 아닙니다. 장비도 필요하고 시간도 많이 듭니다. 그래도 한 번 흐름을 익혀두면 AI가 영상을 어떻게 학습하고 변환하는지 감각적으로 이해하게 됩니다. 최근 등장한 클릭 한 번짜리 페이스스왑 웹 서비스들이 내부에서 무슨 일을 하는지 짐작할 수 있게 되거든요.

처음 도전하신다면 본인 얼굴로 짧은 5초 클립부터 만들어 보세요. 데이터셋이 본인이라 윤리적 부담도 없고, 결과가 어색해도 학습 데이터로 활용할 수 있습니다. 그리고 다시 한 번 강조하지만, 타인의 얼굴을 동의 없이 합성해 공개·배포하는 것은 명백한 범죄입니다. 이 도구는 학습과 창작의 도구로만 다루시길 부탁드립니다.

다음 글에서는 결과물의 자연스러움을 한 단계 끌어올리는 데이터셋 정제 방법과, GPU가 약한 분들을 위한 클라우드 학습 환경 셋업을 다뤄볼 예정입니다.

반응형