RAY REPORT / VIDEO NOTE영상 업로드 2026-07-03 · 정리 2026-08-15

VIDEO SUMMARY · LOCAL LLM / R9700 / HERMES

로컬 LLM 장비,
VRAM부터 보세요

이 영상의 결론은 “가장 큰 모델”이 아니라 내 VRAM 안에 들어오고, 내가 원하는 작업을 끝까지 하는 모델을 고르라는 것입니다.

  • Dante's Datalab
  • 1시간 25분 41초
  • AMD R9700 32GB 실측 소개
  • LM Studio + Hermes

장비 가격·성능 수치·추천은 영상 제작자의 촬영 시점 주장과 테스트입니다. 현재 가격·호환성·라이선스는 구매/도입 직전에 공식 자료로 다시 확인해야 합니다.

VRAM 등급 슬라이드, 터미널, LM Studio, Hermes 에이전트 실습 등 50개 대표 프레임을 시간순으로 모은 접촉시트
85분 영상의 50개 대표 화면 표본. 긴 영상이라 코드·수치의 세부 판독이 아니라 실제 데모 흐름 확인용으로 사용했습니다.

구독료를 없애는 장비가 아니라,
업무를 나누는 선택지

영상이 제안한 로컬 LLM의 강점은 민감 자료·반복 워크플로·문서 작업입니다. 프론티어 모델 전체를 대체한다는 뜻은 아닙니다.

먼저 VRAM, 그다음 모델 구조, 마지막은 실제 완주 테스트

영상은 Q4 양자화 기준으로 VRAM 여유를 남겨 모델을 고르고, 단발 답변이 아니라 코드 작성 → 실행 → 테스트 → 수정 같은 멀티턴 작업이 끝나는지를 보라고 설명합니다.

핵심 병목GPU VRAM
권장 판단용도 우선
영상의 실측 카드R9700 · 32GB
현실적 결과하이브리드 사용

영상의 3단계 선택법

“장비를 산 뒤 모델을 억지로 맞추는” 순서가 아니라, 수행할 일에서 거꾸로 출발합니다.

01

기기

GPU VRAM을 최우선으로, 그다음 시스템 RAM·대역폭·CPU를 봅니다. 영상에서는 16GB·24GB·32GB·48GB 이상을 기능 기대치가 다른 구간으로 설명합니다.

02

모델

파라미터 수, Dense/MoE 구조, Q4 양자화, 컨텍스트 길이를 함께 봅니다. MoE는 활성 파라미터가 작아 빨라질 수 있지만 전체 가중치는 VRAM에 올라가야 한다는 점을 강조합니다.

03

검증

한 번의 질문 대신 연속 작업으로 확인합니다. 특히 에이전트라면 도구 호출, 파일 처리, 테스트·수정 루프가 끊기지 않는지가 더 중요하다는 기준입니다.

!

구매 전 주의: 영상에서 소개한 “파라미터 ÷ 2 ≈ Q4 필요 VRAM”은 빠른 감 잡기용 근사치입니다. 실제로는 모델 포맷, 컨텍스트/KV 캐시, 런타임, 오프로드, 동시 요청 때문에 더 많은 여유가 필요합니다.

모델 이름에서 꼭 분리해 볼 것

영상의 특정 모델·수치 평가는 이 R9700 테스트 환경 기준입니다.

MEMORY

전체 파라미터

VRAM에는 전체 가중치가 올라가야 합니다. “활성 3B”처럼 보이는 MoE 모델도 총 파라미터가 크면 작은 VRAM에서는 못 올릴 수 있습니다.

  • 용량 판단은 총 파라미터 기준
  • Q4는 영상이 주로 쓴 균형점
SPEED

활성 파라미터

MoE는 질문마다 일부 전문가만 활성화해 생성 속도에서 이점이 날 수 있다고 설명합니다. 다만 모든 MoE가 같은 속도·품질을 보장하지는 않습니다.

  • 속도는 활성 구조·런타임 영향
  • 예측표보다 실제 측정 우선
AGENT

컨텍스트와 도구

영상의 Hermes 연결 예시는 큰 컨텍스트와 OpenAI 호환 서버를 전제로 합니다. 모델이 올라가도 에이전트용 컨텍스트·도구 성능이 부족하면 사용 범위가 좁아집니다.

  • 컨텍스트 길이 확인
  • 도구 작업 완주 테스트

핵심+상세 흐름

업로더가 제공한 타임스탬프와 전사 내용을 한국어로 재구성했습니다.

왜 VRAM이 먼저인가

로컬 LLM을 “설치 가능”과 “실용적”으로 구분합니다. 32GB 구간을 사람 개입 없이 짧은 코드 작업을 완주할 수 있는 실용적 에이전트 후보 구간으로 설명합니다.

가격·Q4 양자화·필요 VRAM

R9700 32GB를 16GB 카드와 비교하며, 추론은 학습과 달리 연산량만큼 VRAM 여유가 중요하다고 주장합니다. Q4는 품질과 용량 사이의 절충안으로 소개합니다.

which-llm, 토큰, Dense/MoE

하드웨어 정보를 바탕으로 후보를 좁히는 도구를 보여 주고, 추천 속도는 추정치이므로 실측이 필요하다고 단서를 붙입니다. Dense와 MoE의 용량·속도 차이도 설명합니다.

체감 속도는 3구간

질문을 읽는 prefill, 첫 답이 나오기까지의 TTFT, 생성하는 decode를 분리합니다. 단순 생성 속도 하나보다 실제 지연·출력 길이·작업 흐름을 봐야 한다는 내용입니다.

LM Studio·ROCm·LM Link

헤드리스 Linux에서 LM Studio CLI와 AMD ROCm 런타임을 설정하고, 모델 로드·추론 서버 실행을 시연합니다. 이어 Mac과 iPhone에서 LM Link를 통해 원격 모델을 쓰는 흐름을 보여 줍니다.

Hermes 에이전트 연결

LM Studio의 OpenAI 호환 엔드포인트를 Hermes의 Custom Endpoint로 지정하고, 모델·컨텍스트를 설정해 로컬 서버 모델을 에이전트에 연결하는 흐름을 시연합니다.

Q4 모델 실전 비교

Gemma, Qwen 계열, GPT-OSS, GLM, Kanana, EXAONE 등 여러 후보를 준비해 대화·한국어·에이전트 작업을 비교합니다. 영상상 결과는 모델별 컨텍스트·속도·작업 완주 차이를 중심으로 해석해야 합니다.

되는 것과 안 되는 것

요약·번역·추출·분류·RAG·코딩 보조·짧은 에이전트 작업은 적합하되, 매우 복잡하고 긴 멀티턴 작업은 더 큰 VRAM/모델 또는 클라우드가 낫다는 하이브리드 결론입니다.

실제로 화면에 나온 것

아래는 50개 표본 프레임에서 확인되는 큰 흐름입니다.

VRAM 등급표와 모델 선택 설명 슬라이드

초반 슬라이드: VRAM 등급표, Q4 양자화, Dense/MoE와 평가 축을 설명하는 자료가 실제 화면에 나옵니다.

터미널에서 로컬 LLM 도구를 설정하는 화면

설정 데모: 터미널에서 장비 확인·도구 설치·모델 목록/런타임을 다루는 흐름이 실제로 보입니다.

LM Studio와 원격 연결을 설명하는 화면

원격 사용: LM Studio/LM Link를 통한 원격 클라이언트 사용과 모바일 화면 예시가 보입니다.

Hermes와 로컬 모델의 작업 로그 및 비교 화면

에이전트·비교: Hermes 설정/작업 로그, 모델별 실행 화면과 결과 비교가 이어집니다.

그래픽카드 메모리 결론을 설명하는 진행자와 컴퓨터

마무리: 진행자가 장비 옆에서 GPU 메모리가 핵심이라는 결론과 예산 기준점을 정리합니다.

데모와 언급을 구분하면

영상에서 실제로 시연

  • VRAM·Q4·Dense/MoE·속도 구조를 설명하는 슬라이드
  • Linux 터미널에서 LM Studio CLI·ROCm 런타임·모델 로드·서버 실행 흐름
  • LM Link로 서버 모델을 Mac/iPhone 쪽에서 사용해 보는 흐름
  • Hermes Custom Endpoint에 로컬 OpenAI 호환 서버를 연결하는 설정·실행
  • 여러 로컬 모델의 출력·작업 로그·결과 비교 화면

언급·추천 중심

  • AMD AI PC Launcher의 원클릭 구성 및 Telegram 연동 가능성
  • R9700/다른 GPU의 현재 가격·가성비와 일반적 성능 우위 주장
  • 각 모델의 상업 라이선스·한국어 품질·장기 안정성에 대한 최종 판단
  • 큰 모델·다중 GPU가 필요한 장시간 복잡 작업의 구체적 최적 구성

장비 사기 전, 이렇게 시작

영상의 원칙을 지출 전 체크리스트로 줄였습니다.

01 / WORKLOAD

로컬로 돌릴 일을 세 가지로 적습니다. 예: 비밀 문서 요약, 사내 RAG, 반복 파일 정리.

02 / MEMORY

후보 모델의 총 파라미터·양자화·목표 컨텍스트를 보고 VRAM 여유를 계산합니다.

03 / PROVE

하루 체험·대여·기존 장비에서 먼저 모델을 띄우고, 실제 멀티턴 작업을 끝까지 돌려 봅니다.

04 / HYBRID

민감/반복 업무는 로컬, 어려운 추론·긴 복합 작업은 클라우드에 남기는 기준을 세웁니다.

근거와 확인 범위

원본 영상: Dante's Datalab — 「이거 모르고 장비 사면 돈 날립니다 | 로컬 LLM 현실 + 구축 가이드 (AMD R9700 + Hermes)」 (YouTube, 새 탭)

업로더 설명에서 연결한 도구: LM Studio · Hermes Agent · which-llm · AMD ROCm

정리 기준: yt-dlp 메타데이터/업로더 설명, 분할 Whisper 전사, 영상 전체의 시간순 대표 프레임 50개. 자동 자막은 YouTube 429로 받지 못해 오디오 전사를 사용했습니다. 긴 영상 특성상 프레임은 전체 흐름의 시각적 근거이지, 작은 코드·표 수치를 확정하는 근거가 아닙니다.