먼저 VRAM, 그다음 모델 구조, 마지막은 실제 완주 테스트
영상은 Q4 양자화 기준으로 VRAM 여유를 남겨 모델을 고르고, 단발 답변이 아니라 코드 작성 → 실행 → 테스트 → 수정 같은 멀티턴 작업이 끝나는지를 보라고 설명합니다.
VIDEO SUMMARY · LOCAL LLM / R9700 / HERMES
이 영상의 결론은 “가장 큰 모델”이 아니라 내 VRAM 안에 들어오고, 내가 원하는 작업을 끝까지 하는 모델을 고르라는 것입니다.
장비 가격·성능 수치·추천은 영상 제작자의 촬영 시점 주장과 테스트입니다. 현재 가격·호환성·라이선스는 구매/도입 직전에 공식 자료로 다시 확인해야 합니다.

ONE-LINE VERDICT
영상이 제안한 로컬 LLM의 강점은 민감 자료·반복 워크플로·문서 작업입니다. 프론티어 모델 전체를 대체한다는 뜻은 아닙니다.
영상은 Q4 양자화 기준으로 VRAM 여유를 남겨 모델을 고르고, 단발 답변이 아니라 코드 작성 → 실행 → 테스트 → 수정 같은 멀티턴 작업이 끝나는지를 보라고 설명합니다.
DECISION PIPELINE
“장비를 산 뒤 모델을 억지로 맞추는” 순서가 아니라, 수행할 일에서 거꾸로 출발합니다.
GPU VRAM을 최우선으로, 그다음 시스템 RAM·대역폭·CPU를 봅니다. 영상에서는 16GB·24GB·32GB·48GB 이상을 기능 기대치가 다른 구간으로 설명합니다.
파라미터 수, Dense/MoE 구조, Q4 양자화, 컨텍스트 길이를 함께 봅니다. MoE는 활성 파라미터가 작아 빨라질 수 있지만 전체 가중치는 VRAM에 올라가야 한다는 점을 강조합니다.
한 번의 질문 대신 연속 작업으로 확인합니다. 특히 에이전트라면 도구 호출, 파일 처리, 테스트·수정 루프가 끊기지 않는지가 더 중요하다는 기준입니다.
구매 전 주의: 영상에서 소개한 “파라미터 ÷ 2 ≈ Q4 필요 VRAM”은 빠른 감 잡기용 근사치입니다. 실제로는 모델 포맷, 컨텍스트/KV 캐시, 런타임, 오프로드, 동시 요청 때문에 더 많은 여유가 필요합니다.
MODEL CHOICE
영상의 특정 모델·수치 평가는 이 R9700 테스트 환경 기준입니다.
VRAM에는 전체 가중치가 올라가야 합니다. “활성 3B”처럼 보이는 MoE 모델도 총 파라미터가 크면 작은 VRAM에서는 못 올릴 수 있습니다.
MoE는 질문마다 일부 전문가만 활성화해 생성 속도에서 이점이 날 수 있다고 설명합니다. 다만 모든 MoE가 같은 속도·품질을 보장하지는 않습니다.
영상의 Hermes 연결 예시는 큰 컨텍스트와 OpenAI 호환 서버를 전제로 합니다. 모델이 올라가도 에이전트용 컨텍스트·도구 성능이 부족하면 사용 범위가 좁아집니다.
TIMELINE
업로더가 제공한 타임스탬프와 전사 내용을 한국어로 재구성했습니다.
로컬 LLM을 “설치 가능”과 “실용적”으로 구분합니다. 32GB 구간을 사람 개입 없이 짧은 코드 작업을 완주할 수 있는 실용적 에이전트 후보 구간으로 설명합니다.
R9700 32GB를 16GB 카드와 비교하며, 추론은 학습과 달리 연산량만큼 VRAM 여유가 중요하다고 주장합니다. Q4는 품질과 용량 사이의 절충안으로 소개합니다.
하드웨어 정보를 바탕으로 후보를 좁히는 도구를 보여 주고, 추천 속도는 추정치이므로 실측이 필요하다고 단서를 붙입니다. Dense와 MoE의 용량·속도 차이도 설명합니다.
질문을 읽는 prefill, 첫 답이 나오기까지의 TTFT, 생성하는 decode를 분리합니다. 단순 생성 속도 하나보다 실제 지연·출력 길이·작업 흐름을 봐야 한다는 내용입니다.
헤드리스 Linux에서 LM Studio CLI와 AMD ROCm 런타임을 설정하고, 모델 로드·추론 서버 실행을 시연합니다. 이어 Mac과 iPhone에서 LM Link를 통해 원격 모델을 쓰는 흐름을 보여 줍니다.
LM Studio의 OpenAI 호환 엔드포인트를 Hermes의 Custom Endpoint로 지정하고, 모델·컨텍스트를 설정해 로컬 서버 모델을 에이전트에 연결하는 흐름을 시연합니다.
Gemma, Qwen 계열, GPT-OSS, GLM, Kanana, EXAONE 등 여러 후보를 준비해 대화·한국어·에이전트 작업을 비교합니다. 영상상 결과는 모델별 컨텍스트·속도·작업 완주 차이를 중심으로 해석해야 합니다.
요약·번역·추출·분류·RAG·코딩 보조·짧은 에이전트 작업은 적합하되, 매우 복잡하고 긴 멀티턴 작업은 더 큰 VRAM/모델 또는 클라우드가 낫다는 하이브리드 결론입니다.
VIDEO EVIDENCE
아래는 50개 표본 프레임에서 확인되는 큰 흐름입니다.

초반 슬라이드: VRAM 등급표, Q4 양자화, Dense/MoE와 평가 축을 설명하는 자료가 실제 화면에 나옵니다.

설정 데모: 터미널에서 장비 확인·도구 설치·모델 목록/런타임을 다루는 흐름이 실제로 보입니다.

원격 사용: LM Studio/LM Link를 통한 원격 클라이언트 사용과 모바일 화면 예시가 보입니다.

에이전트·비교: Hermes 설정/작업 로그, 모델별 실행 화면과 결과 비교가 이어집니다.

마무리: 진행자가 장비 옆에서 GPU 메모리가 핵심이라는 결론과 예산 기준점을 정리합니다.
SHOWN / MENTIONED
START SMALL
영상의 원칙을 지출 전 체크리스트로 줄였습니다.
로컬로 돌릴 일을 세 가지로 적습니다. 예: 비밀 문서 요약, 사내 RAG, 반복 파일 정리.
후보 모델의 총 파라미터·양자화·목표 컨텍스트를 보고 VRAM 여유를 계산합니다.
하루 체험·대여·기존 장비에서 먼저 모델을 띄우고, 실제 멀티턴 작업을 끝까지 돌려 봅니다.
민감/반복 업무는 로컬, 어려운 추론·긴 복합 작업은 클라우드에 남기는 기준을 세웁니다.
SOURCES & LIMITS
원본 영상: Dante's Datalab — 「이거 모르고 장비 사면 돈 날립니다 | 로컬 LLM 현실 + 구축 가이드 (AMD R9700 + Hermes)」 (YouTube, 새 탭)
업로더 설명에서 연결한 도구: LM Studio · Hermes Agent · which-llm · AMD ROCm
정리 기준: yt-dlp 메타데이터/업로더 설명, 분할 Whisper 전사, 영상 전체의 시간순 대표 프레임 50개. 자동 자막은 YouTube 429로 받지 못해 오디오 전사를 사용했습니다. 긴 영상 특성상 프레임은 전체 흐름의 시각적 근거이지, 작은 코드·표 수치를 확정하는 근거가 아닙니다.