참고 · 선택

Claude에게 영상 보여주기

Claude에게는 영상 입력이 없습니다. /watch 스킬이 눈과 귀를 붙여줍니다.

  • 1링크만 줘서는 왜 안 되는지 안다
  • 2watch 스킬을 설치하고 준비물을 갖춘다
  • 3구간을 찍어 토큰을 아낀다
읽는 시간 7분실습 15분선수 없음 · 선택
자세히 보기
① 받는다yt-dlpURL · 로컬 파일② 뜯는다프레임 · 자막ffmpeg · Whisper③ 본다Claude이미지로 읽는다화면은 이미지로, 말은 자막으로 — 둘 다 넘겨줍니다
문제왜 필요한가

유튜브 링크를 줘도 못 봅니다

Claude는 웹페이지를 읽고 코드를 돌리지만, 영상은 입력으로 받지 못합니다. 링크를 붙여넣으면 제목으로 추측하거나 자막 일부만 보고 답합니다. 화면에 무엇이 떠 있었는지는 모릅니다.

/watch는 그 구멍을 메웁니다. 영상을 Claude가 볼 수 있는 형태로 바꿔서 건네줍니다 — 화면은 이미지 여러 장으로, 말은 시각이 붙은 자막으로. 그래서 "설명에 따르면"이 아니라 본 대로 답합니다.

핵심영상을 이해시키는 게 아니라, 영상을 이미지와 글로 바꿔서 넣어줍니다.
동작다섯 단계

안에서 무슨 일이 일어나나

단계도구하는 일
① 받기yt-dlpURL이면 임시 폴더에 내려받습니다. 로컬 파일이면 그대로 씁니다
② 프레임ffmpeg길이에 맞춰 장수를 자동으로 정해 JPEG로 뜹니다 (기본 가로 512px)
③ 자막yt-dlp / Whisper원본 자막을 먼저 씁니다. 없으면 소리만 뽑아 Whisper API로 받아씁니다
④ 읽기Claude프레임 파일을 Read로 열면 이미지로 보입니다. 자막과 시각을 맞춰 답합니다
⑤ 정리더 물어볼 게 없으면 작업 폴더를 지웁니다

지원 대상은 yt-dlp가 되는 곳 전부입니다 — YouTube · Vimeo · TikTok · X · Loom 등. 로컬 파일은 .mp4 .mov .mkv .webm.

설치플러그인

붙이는 방법

Claude Code에서는 마켓플레이스를 등록하고 플러그인을 설치합니다.

/plugin marketplace add bradautomates/claude-video
/plugin install watch@claude-video

준비물은 ffmpegyt-dlp 두 가지입니다. 처음 /watch를 부르면 스킬이 먼저 점검하고, 없으면 설치 방법을 알려줍니다 — macOS는 brew로 자동 설치, Windows·Linux는 실행할 명령을 출력합니다.

항목필요한 때비용
ffmpeg · yt-dlp항상무료
원본 자막영상에 자막이 있으면 자동으로 사용무료
Whisper API 키자막이 없는 영상에만 — 화면 녹화, 일부 짧은 영상Groq 권장 · OpenAI 가능

키는 ~/.config/watch/.env에 저장됩니다. 키 없이 쓰려면 --no-whisper를 붙이면 되고, 이때 자막 없는 영상은 화면만 보게 됩니다.

Windows스킬 문서의 python3는 macOS · Linux 기준입니다. Windows에서는 python으로 불러야 합니다 — python3는 Microsoft Store 안내창만 뜹니다.
예시쓰는 법

링크 뒤에 질문을 붙인다

/watch https://youtu.be/abc123 30초 지점에서 무슨 일이 일어나?
/watch https://youtu.be/abc123 이 영상 요약해줘
/watch ./bug-repro.mp4 화면이 언제 깨지는지 찾아줘
/watch https://vimeo.com/123 발표자가 언급한 도구를 목록으로 정리해줘

실무에서 자주 쓰는 쪽은 셋입니다. 남의 콘텐츠 분석(도입 3초를 어떻게 열었나), 버그 화면 녹화 진단(어느 프레임에서 깨지나), 긴 영상 요약(20분을 안 보고 끝내기).

구간을 찍으면 훨씬 정확해집니다

영상이 길면 전체를 듬성듬성 훑는 것보다 그 30초를 촘촘히 보는 쪽이 낫습니다. 시각은 SS · MM:SS · HH:MM:SS 아무 형식이나 됩니다.

/watch <url> --start 2:15 --end 2:45     # 2분 15초부터 45초까지
/watch video.mp4 --start 50 --end 60     # 50초~60초
/watch <url> --start 1:12:00             # 1시간 12분부터 끝까지
옵션하는 일
--start / --end구간 지정. 자막도 같은 구간만 잘라 씁니다
--max-frames N장수 상한을 낮춰 토큰을 아낍니다
--resolution W프레임 가로폭 (기본 512). 화면의 글자를 읽혀야 할 때만 1024
--fps F초당 장수 직접 지정 (최대 2장)
--whisper groq|openai받아쓰기 백엔드를 고정합니다
--no-whisper받아쓰기를 끕니다 — 화면만 봅니다
비용프레임이 곧 토큰

길수록 성기게 봅니다

비용의 대부분은 프레임 이미지입니다. 그래서 길이에 따라 장수를 자동으로 조절하고, 초당 2장 · 총 100장을 넘기지 않습니다.

영상 길이프레임체감
30초 이하약 30장촘촘 — 거의 모든 순간
30초 ~ 1분약 40장촘촘
1 ~ 3분약 60장무난
3 ~ 10분약 80장성김
10분 초과100장경고가 뜹니다 — 구간을 찍는 게 낫습니다

512px 80장이면 대략 5만~8만 토큰입니다. --resolution 1024로 올리면 프레임당 토큰이 네 배가 되니, 슬라이드나 터미널 글자를 읽혀야 할 때만 쓰세요.

밖으로 나가는 것 · 나가지 않는 것자막이 있으면 아무것도 나가지 않습니다. 자막이 없을 때만 소리만 뽑아 Whisper API(Groq 또는 OpenAI)로 보냅니다. 영상 자체는 업로드하지 않습니다. 그래도 사내 영상이라면 --no-whisper로 쓰거나 사내 정책을 먼저 확인하세요 — 0-3 안전하게 쓰는 기준.

알아둘 한계

한계대응
10분이 넘으면 성긴 스캔--start / --end로 구간 지정
Whisper 업로드 25MB (모노 16kHz 기준 약 50분)구간을 좁히거나 자막 있는 원본 사용
로그인이 필요한 비공개 영상은 불가파일을 내려받아 로컬 경로로 넘기기
같은 영상을 다시 물어보면 재실행 낭비이미 문맥에 있으니 그냥 이어서 물어보면 됩니다
클로드코드 시작하기참고 · 선택