video-transcript
视频与播客文字提取:下载音视频后调用夸克网盘 Skill 云端取稿,再由模型轻校对。 支持单条和批次、已上传网盘文件、持久对应关系与中断恢复。用于“逐字稿、转文字、提取文案” 或附音视频链接的提取请求。默认不运行本地 ASR;不承诺说话人分离、句级时间轴或 SRT。
インストール方法を見る含まれるファイル(28)
- SKILL.md7.2 KB
- .github/workflows/validate.yml669 B
- .gitignore240 B
- bootstrap.sh4.4 KB
- docs/agent-community.png59.8 KB
- docs/legacy-FALLBACK.md8.2 KB
- docs/legacy-README.md11.3 KB
- FALLBACK.md371 B
- install.sh2.5 KB
- LICENSE1.0 KB
- README.md4.0 KB
- references/quark-workflow.md4.5 KB
- requirements.txt35 B
- scripts/asr_daemon.py10.2 KB
- scripts/caller_client.py11.2 KB
- scripts/diarize_asr.py11.5 KB
- scripts/make_optimized.py17.7 KB
- scripts/platform_extractor.py13.0 KB
- scripts/podcast_extractor.py3.8 KB
- scripts/podcast_glossary.py6.5 KB
- scripts/preorganize.py8.6 KB
- scripts/quark_transcript.py29.9 KB
- scripts/speaker_postprocess.py25.1 KB
- scripts/sph_resolver.py21.4 KB
- scripts/transcript.py3.0 KB
- skills/weixin-layout.md2.8 KB
- tests/test_quark_pipeline.py11.8 KB
- tests/test_wechat_reliability.py7.1 KB
SKILL.md(原文)
インストールする前に、エージェントに与えられる指示の中身を確認できます。
视频文案提取:夸克云端版
链接 / 本地媒体 / 已指定的网盘文件 → 登记 → 下载或匹配 → 上传并核对 → 单文件问答取正文 → 质量检查 → 模型 patch 轻校对。
入口与依赖
使用本次读取的这份 SKILL.md 所在目录作为 VT_HOME。不要按 WorkBuddy/Codex 等优先级另找一份 video-transcript;不能把其他副本当成这份的运行目录。
VT_PY 使用可运行脚本的 Python 3.9+,不必寻找装有 FunASR 的解释器。
首次执行先读已安装 quarkclouddrive/SKILL.md 及本次涉及的 references/file-upload.md、references/file-search.md、references/assistant.md。
下载沿用 video-download;平台解析所需登录态仍按该 Skill 处理。夸克 CLI 是外部依赖,不复制其源码或凭据。本脚本会在每次调用夸克命令前运行官方环境检查,并使用同一批次会话 ID。
python3 "$VT_HOME/scripts/transcript.py" --doctor
该体检只检查本地工具与依赖位置,不代表授权或云端链路成功。缺少夸克 Skill 时按其安装说明安装;不要运行旧版 ASR 安装步骤。需要安装下载依赖才运行本 Skill 的 install.sh;已有 .env、outputs 和模型缓存保留。
单条与批次
用户明确选择此 Skill 的云端工作流,即按任务范围上传指定媒体。用户要求只下载时转交 video-download。
保存用户本轮原始请求为临时 UTF-8 文件,通过 --session-input-file 传入;这是夸克要求的服务质量追踪参数,不应塞入额外对话或凭据。
python3 "$VT_HOME/scripts/transcript.py" "<链接或本地路径>" --session-input-file "<原始请求文件>" --wait 1800
python3 "$VT_HOME/scripts/transcript.py" --batch "<inputs.json>" --session-input-file "<原始请求文件>" --wait 1800
等待值是本次进程的复查预算,不是预计完成时间;单次网络请求可能在预算结束后才返回。
批次 JSON 是输入字符串数组,或包含 input、可选 title 的对象数组。
截图 PDF 保留 --keep-video 兼容参数;新版媒体默认持久保存,不自动删本地文件或云端文件。
已上传网盘文件的选定、参数、缓存与错误恢复见 references/quark-workflow.md。
状态和中断恢复
每条文件有固定 asset_id;所有批次复用同一 output-dir 内的条目记录。通过来源链接或本地内容 SHA256 识别任务,不靠标题和完成顺序关联。 上传原始 ID 与搜索返回 FID 分开存。读取完整 Artifact,并按唯一文件名、大小及上传时间(时长返回时另核对)绑定;匹配不唯一就停该条。 一条问答只传一个文件,原始响应与每次请求单独留档。上传结果未知不盲目重传。
text_received:取回了可供审阅的正文,不是逐字准确或全文已验证。waiting_analysis:保持 FID,按 next_poll_at 复查,初期 60 秒,随后 120/300 秒。response_needs_review:疑似摘要、缺来源、过短或不完整。读 raw.md,不直接润色成“完整稿”。mapping_needs_review/upload_outcome_unknown:核对对应关系,不猜、不重新上传。auth_required:按夸克 Skill 引导 login,完成后用原批次明确重试。qa_failed/failed:说明原因,修复后恢复,不自动无限重试。
python3 "$VT_HOME/scripts/transcript.py" --resume "<batch_manifest>" --status
python3 "$VT_HOME/scripts/transcript.py" --resume "<batch_manifest>" --session-input-file "<原始请求文件>" --wait 1800
退出码 0=本次各条已取回正文;2=仍有等待;1=需要处理错误或人工核对。退出码不代表质量验收。 任务终止后没有自动唤醒;只在用户请求后台监测时另接调度。不能用“已保存等待状态”冒充会自动继续。
取稿后:模型必须检查并轻校对
输出包含 batch_manifest、各条状态,以及可用的 transcript_path、preorganized_path、polish_brief_path。 先读完整原始返回与预整理稿,核对来源是否对应、是否摘要/拒绝/明显截断,条件允许时抽查首中尾字幕或听校。字数和首尾覆盖只能作为抽查,不能证明逐句完整。
普通视频:读 polish_brief,写一份 patch.json,再调用:
python3 "$VT_HOME/scripts/make_optimized.py" --from-md "<preorganized_path>" --patch "<patch.json>" --filename "<asset_id>_整理稿" --output-dir "<该条产物目录>"
patch 使用 title、headings、fixes(from/to/confidence/basis)和必要的 paragraph_edits。保留顺序、数字、观点;高确信且有依据才替换,低确信只列待核。不要补写缺段、推测说话人或编造时间轴。渲染器支持无时间标记的章节,并保留补丁记录。 修改后回读,核对没有整段丢失。保留夸克原始返回,润色稿独立交付。单条用户要求全文时在对话输出全文;批次优先交付汇总表与每条稿件链接,避免四份长稿互相混杂。
微信视频号:读 skills/weixin-layout.md,保留默认口语稿、文字 PDF、截图 PDF 的分流。无时间轴时截图与正文需实际核对,不得按虚构时间自动配图。 播客:同样先取纯文字,再轻校对。旧 --speakers/--host/--guest 明确报不支持,不转本地模型、不伪造人物归属。
交付边界
分别报告:文件对应、正文取回、抽查或听校程度、润色完成。历史专名、古文和无字幕材料要保留待核点。 --force 只重新请求正文,复用原上传;--reformat 只从已保存原文重建预整理。不自动读取旧 FunASR 缓存,旧文件不删除。
上游 Skill 的稳定接入
供 deep-search、视频博主拆解使用的适配器为 scripts/caller_client.py,不复制夸克运行时。先通过 --batch ... --status 本地登记,再持久保存 asset_id/manifest 后开始云端请求;适配器按完整 stdout JSON 和条目 state.json 读取结果,schema_version=1。
同一调用方工作目录保存 session.json;--session-id 可在新批次登记时指定 {timestamp}-{6位随机字符},已有批次继续使用原值。所有实际云端调用仍传原始请求文件。
适配器保留 waiting_analysis、response_needs_review、mapping_needs_review、upload_outcome_unknown、auth_required 等状态。无音轨标 no_audio,媒体保留且不上传/问答;缺衍生稿可本地重建。取帧只接受记录中且 SHA256 相符的媒体,未核对的目录文件不能作为替代。
调用方显式使用 --repair-media 时,适配器仅补下载缺失媒体,要求与原哈希一致;不重新上传或问答。字节不同保留候选并停下核对。没有可核对的原链接或哈希时不能自动修复。
レビュー
まだレビューはありません。使ってみた感想をお寄せください。