claudekit / tools / video-use
[ Skill · Design ]

video-use

Claude Code로 대화하며 영상을 편집하는 스킬. 원본 프레임 대신 ElevenLabs Scribe로 음성을 텍스트로 옮긴 transcription(단어 단위 타임스탬프)과 온디맨드 타임라인 이미지를 사용해 토큰을 아끼면서, 필러워드, 공백 제거부터 컬러 그레이딩, 자막, 애니메이션 오버레이까지 처리한다. 100% 오픈소스.

browser-use/video-use ·updated
$ git clone https://github.com/browser-use/video-use ~/Developer/video-use && ln -sfn ~/Developer/video-use ~/.claude/skills/video-use && cd ~/Developer/video-use && uv sync && brew install ffmpeg copy

browser-use 팀이 만든 오픈소스 스킬(browser-use/video-use).

왜 필요한가?

영상 편집을 코딩 에이전트에게 맡기려면 두 가지가 걸립니다. 하나는 원본 프레임을 그대로 모델에 넣으면 토큰이 폭발한다는 점, 다른 하나는 “필러워드를 지워줘”, “컷 사이를 자연스럽게 해줘” 같은 지시를 프레임 좌표가 아니라 말의 흐름 위에서 처리해야 한다는 점입니다.

video-use는 두 계층으로 이 문제를 풉니다. (1) ElevenLabs Scribe로 음성을 텍스트로 옮긴 transcription으로 단어 단위 타임스탬프와 화자 분리 정보를 약 12KB 텍스트로 압축하고, (2) 결정이 필요한 지점에서만 온디맨드 타임라인 이미지(timeline_view PNG)를 확인합니다. 덕분에 과도한 토큰 없이 단어 경계 단위로 정밀하게 편집합니다. README 표기 그대로 “Edit videos with Claude Code.”

무엇을 만들 수 있나

영상이 든 폴더에서 claude를 실행하고 편집을 자연어로 지시하면, 다음을 처리합니다(README 기준).

  • 필러워드, 죽은 시간 제거 — “음”, “어” 같은 필러워드와 테이크 사이 공백을 잘라냄
  • 컬러 그레이딩 — 구간별로 색 보정 적용
  • 컷 오디오 페이드 — 컷 지점에 30ms 오디오 페이드를 넣어 팝 노이즈 방지
  • 자막 번인 — 커스터마이즈 가능한 자막을 영상에 새김
  • 애니메이션 오버레이 — HyperFrames, Remotion, Manim, PIL로 오버레이 생성
  • 자기 평가 루프 — 렌더 결과를 컷 경계에서 스스로 검토해 시각적 점프, 오디오 팝을 잡음

작업 흐름은 “폴더에서 claude 실행 → 편집 지시 → transcription, 타임라인 기반으로 편집, 렌더 → 컷 경계 자기 평가”입니다. 세션 메모리는 project.md에 남아 다음 세션으로 이어집니다.

애니메이션 오버레이 백엔드로 쓰이는 HyperFrames는 ClaudeKit에도 별도 등재되어 있습니다.

핵심 기능

  • transcription 기반 편집

    ElevenLabs Scribe의 단어 단위 타임스탬프와 화자 분리를 사용해 말의 흐름 위에서 편집합니다. 프레임이 아니라 단어 경계로 컷을 잡습니다.

  • 온디맨드 타임라인 이미지

    전 구간을 이미지로 훑지 않고, 결정이 필요한 지점에서만 timeline_view PNG를 생성해 시각적으로 판단합니다. 토큰 사용을 줄입니다.

  • 자기 평가 루프

    렌더된 결과를 컷 경계에서 스스로 확인해 시각적 점프와 오디오 팝을 잡아냅니다.

  • 세션 간 메모리

    project.md에 프로젝트 상태를 기록해 세션이 바뀌어도 편집 맥락을 이어갑니다.

  • 콘텐츠 유형 무관

    토킹헤드, 몽타주, 튜토리얼 등 특정 콘텐츠 유형을 가정하지 않고 동작한다고 README는 표기합니다.

사용 방법

설치 — 리포를 clone해 스킬 디렉토리로 심링크하고, 의존성과 ffmpeg를 설치합니다.

git clone https://github.com/browser-use/video-use ~/Developer/video-use
ln -sfn ~/Developer/video-use ~/.claude/skills/video-use
cd ~/Developer/video-use
uv sync
brew install ffmpeg
cp .env.example .env
# .env에 ELEVENLABS_API_KEY 추가

실행 — 영상 파일이 있는 폴더에서 claude를 실행하고 편집을 지시합니다.

알아두면 좋은 점

  • ElevenLabs API 키 필수ElevenLabs는 AI 음성, 오디오 서비스이고, Scribe는 그 speech-to-text(음성을 텍스트로 옮기는) 모델입니다. video-use는 이 Scribe로 단어 단위 타임스탬프가 붙은 transcription을 만들기 때문에 ELEVENLABS_API_KEY가 필요합니다(API 키 발급). 유일한 transcription 백엔드라 키가 없으면 동작하지 않으며, 사용량에 따라 비용이 발생할 수 있습니다.
  • ffmpeg 필요 — 렌더링에 ffmpeg가 필요합니다(brew install ffmpeg).
  • 애니메이션 백엔드 — 오버레이는 HyperFrames, Remotion, Manim, PIL 중에서 생성합니다.
  • 100% 오픈소스 — 리포는 MIT 라이선스로 공개되어 있습니다.
§ 6

See also

same category · curated
[01]
[Tool] HyperFrames · Write HTML. Render video. Built for agents. HTML, CSS, 미디어, 애니메이션을 결정적(deterministic) MP4 영상으로 렌더링하는 오픈소스 프레임워크입니다. 에이전트가 평범한 HTML 컴포지션을 작성하면 비대화형 CLI가 영상으로 출력하며, npx skills add로 Claude Code 같은 코딩 에이전트에 스킬로 설치합니다. HeyGen이 Apache-2.0으로 공개했습니다.
tool · claudekit.io / tools / hyperframes
[02]
[MCP] Figma MCP · Figma 공식 MCP 서버. 디자인 파일 읽기/쓰기, 코드 변환, 컴포넌트 추출을 Claude Code에서 직접 수행.
tool · claudekit.io / tools / figma
[03]
[Plugin] Frontend Design · 프론트엔드 UI를 전문 디자이너 수준으로 생성하도록 가이드하는 플러그인.
tool · claudekit.io / tools / frontend-design
§ 7

자주 묻는 질문

자주 묻는 질문
§ 7.1
video-use는 무엇인가요?
Claude Code로 대화하며 영상을 편집하는 스킬입니다. README 표기 그대로 "Edit videos with Claude Code. 100% open source." 영상이 든 폴더에서 `claude`를 실행하고 편집 지시를 자연어로 내리면 됩니다.
§ 7.2
어떤 환경에서 동작하나요?
Claude Code용 스킬로, `~/.claude/skills/video-use`에 심링크로 설치합니다. README는 Codex 등 다른 코딩 에이전트와도 호환된다고 표기합니다. ffmpeg가 필요합니다.
§ 7.3
어떻게 설치하나요?
리포를 clone해 `~/.claude/skills/video-use`로 심링크하고, `uv sync`와 `brew install ffmpeg`를 실행한 뒤 `.env`에 `ELEVENLABS_API_KEY`를 넣습니다.
§ 7.4
무엇이 필요한가요? 무료인가요?
스킬 자체는 100% 오픈소스입니다. 다만 음성을 텍스트로 옮기는 transcription에 ElevenLabs Scribe API 키(`ELEVENLABS_API_KEY`)가 반드시 필요하며(없으면 동작하지 않음, 대체 백엔드 없음), ffmpeg도 설치해야 합니다. ElevenLabs 사용량에는 비용이 발생할 수 있습니다.
§ 7.5
원본 영상을 프레임 단위로 다 읽나요?
아니요. 프레임을 통째로 처리하는 대신 ElevenLabs Scribe로 음성을 텍스트로 옮긴 transcription(단어 단위 타임스탬프, 화자 분리)을 약 12KB 텍스트로 압축하고, 결정이 필요한 지점에서만 온디맨드 타임라인 이미지(timeline_view PNG)를 봅니다. 그래서 토큰 사용을 아끼면서 단어 경계 단위로 정밀하게 편집합니다.