- 01선택자 유지보수: 사이트 구조가 달라져도 저장한 요소의 특징을 바탕으로 비슷한 대상을 다시 찾는 적응형 파싱을 장점으로 제시합니다.
- 02필요할 때만 무겁게: 정적 HTML·JSON API에는 HTTP 요청, 동적 렌더링에는 브라우저, 보호가 강한 경우에만 더 높은 계층을 쓴다는 흐름입니다.
- 03운영까지 포함: 스파이더, 중복 제거, 세션, 캐시, 재개, CLI·MCP를 한 생태계로 묶어 에이전트 작업에도 쓰기 좋다고 설명합니다.
이 페이지는 영상 요약이며, 자동 수집의 권한을 보장하지 않습니다
사이트 이용약관, robots.txt, 개인정보·저작권, 요청 속도 제한을 먼저 확인해야 합니다. 영상에 등장하는 차단·탐지 대응 기능은 기술 소개로만 정리했으며, 차단을 우회하는 실행 절차는 다루지 않습니다.
3줄 핵심
00:00–08:50
영상이 설명한 3단계 선택
낮은 비용부터 검토한다는 흐름
16:04–18:59
LEVEL 01
HTTP Fetcher
브라우저 없이 정적 페이지나 JSON API를 빠르게 가져오는 첫 단계로 소개됩니다.
- 가벼운 리소스 사용
- JS 렌더링은 하지 못함
- 대상 API가 공개·허용된 경우에 적합
LEVEL 02
Dynamic Fetcher
Playwright 기반으로 브라우저를 구동해 자바스크립트로 생성되는 콘텐츠를 렌더링하는 단계입니다.
- 클릭·스크롤·대기 같은 화면 흐름
- 불필요한 이미지·폰트 차단 등 성능 옵션
- 브라우저 비용이 생김
LEVEL 03
Stealth Fetcher
영상은 강한 탐지 환경용 최상위 계층으로 소개합니다. 사용할 수 있다는 주장과 별개로, 정책·법적 허용 범위의 확인이 먼저입니다.
- 가장 높은 자원·운영 비용
- 서비스 약관 및 접근 통제 존중
- 차단을 만나면 우회보다 중단·검토가 기본
시간대별 상세 흐름
전체 42:43 기준
Whisper 음성 전사 + 화면 샘플 검토
find_similar과 저장·매칭을 통해 바뀐 선택자를 다시 찾는 적응형 기능을 핵심 차별점으로 듭니다.영상 속 화면
강의의 실제 슬라이드·데모 화면
프레임 샘플




실제 데모와 영상의 주장
구분해서 보면 과장 해석을 줄일 수 있습니다
화면으로 확인된 것
영상에서 직접 보여 준 범위
- G마켓 화면과 개발자 도구의 Network/XHR 탐색 예시
- Scrapling의 구성도, 파싱·패칭·Spider 관련 슬라이드
- G마켓 URL을 입력한 뒤 에이전트가 수집 계획·파일·결과 보고서를 만드는 흐름
- CDP·스파이더·MCP 등 도구 소개 화면
별도 검증이 필요한 주장
영상 발표자의 설명 또는 라이브러리 문서 기반 소개
- 사이트 구조 변경 뒤 선택자를 얼마나 안정적으로 복구하는지
- 각 사이트에서의 차단 대응 성공률과 재현성
- 벤치마크 수치와 BeautifulSoup 등 다른 라이브러리 대비 성능
- 특정 사이트·계정·네트워크에서의 접근 허용 여부
내가 적용한다면 먼저 볼 체크리스트
도구 선택보다 수집 목적과 권한을 먼저 고정
- 공식 API·공개 데이터가 있는가가장 먼저 공식 API, RSS, 공개 다운로드를 찾고 그 경로를 우선합니다.
- 수집 권한이 명확한가약관·robots.txt·로그인 제한·저작권·개인정보 처리 근거를 확인합니다.
- 데이터 최소화가 되었는가필요한 필드만, 필요한 주기로 가져오고 보관 기간을 정합니다.
- 낮은 비용 경로부터 검증했는가브라우저 자동화 전에 허용된 HTTP/API 경로로 소량 검증합니다.
- 차단·캡차·로그인 요구 시 멈추는가접근 통제 신호를 우회하지 말고 목적·권한·대체 수단을 재검토합니다.
- 결과를 표본 검증하는가중복·누락·필드 오류를 실제 페이지와 비교하고 수집 시각·출처를 남깁니다.
근거와 한계
요약의 신뢰 범위
원본 자막 다운로드는 YouTube 요청 제한(429)으로 실패해 Whisper 전사를 사용했습니다. 고유명사·코드 식별자에는 전사 오차가 있을 수 있으며, 이 문서는 개별 사이트에 대한 사용 허가나 기술적 성공을 보증하지 않습니다.
