TRANSCRIBE · REVIEW · REUSE

小D · 音视频
转录 Agent

把音视频内容整理为可核验、可复用的文字初稿;把不确定的地方,明确留给人工确认。

公开演示模式:不连接真实 Agent,不处理用户数据,也不会发起任何平台访问。

DEMO SESSION / 00:42READY
3本地处理工具
5固定交付模块
0真实 API 调用
100%预置演示数据

01 / WORKFLOW

从素材到可核验初稿

展示工作流,不会实际下载、转换或识别任何文件。

01

接收素材

展示:音频、视频或授权链接进入任务队列。

02

整理音轨

展示:使用 FFmpeg 将素材转为适合识别的音轨。

03Aa

生成初稿

展示:faster-whisper 输出含时间定位的转录初稿。

04

人工可核验

展示:术语、数字和低置信度片段进入待确认清单。

02 / SIMULATED JOB

模拟任务工作台

所有按钮仅切换本地预置状态,不发送网络请求。

PROCESSING TIMELINE已准备
  1. 01
    素材已接收演示音频已就绪
  2. 02
    音轨标准化等待模拟执行
  3. 03
    语音转录等待模拟执行
  4. 04
    术语与质量检查等待模拟执行
  5. 05
    生成交付结果等待模拟执行
SIMULATED DELIVERABLENO DATA LEAVES THIS PAGE

1. 转录稿链接

演示文件 · demo-transcript.md仅展示,不生成、不下载真实文件。

2. 内容摘要

一段中英混合的产品讨论,围绕音视频转录、术语校验和人工复核展开。

3. 关键结论

  • 机器转录可快速产出内容初稿。
  • 英文术语、人名、数字仍需要人工抽检。

4. 行动项

  • 补充专有名词词表。
  • 回听并确认低置信度片段。

5. 待确认问题

待核chatgpt / 00:00:12示例标记;不代表真实识别结果。

03 / CAPABILITIES

能力清晰,边界同样清晰

VERIFIED / 已验证基础环境

本机转录工具链

  • yt-dlp:下载授权链接素材
  • FFmpeg:音视频读取与格式转换
  • faster-whisper:本地语音识别依赖可导入
  • 飞书消息入口:用于接收与回复任务
PLANNED / 规划中能力

更可靠的正式交付

  • 专有名词词表与统一术语校验
  • 固定五段式交付结构
  • 低置信度片段与时间戳复核
  • 多人音频的说话人区分

不接真实 API

本页没有上传、下载、模型调用、Webhook 或 Serverless Function。

不替代人工确认

人名、数字、年份、英文术语和低置信度内容仍需回听核验。

仅处理授权素材

真实使用时,只应处理拥有下载、转录及使用权限的内容。

04 / TOOL STACK

工具清单

每一层负责不同的工作;展示页本身不加载或调用它们。

Hermes消息接收、任务编排与交付回复
飞书 Gateway私聊与群聊的消息入口
yt-dlp授权链接素材下载
FFmpeg格式转换与音轨处理
faster-whisper本地语音识别转录
Codex配置、验证与持续优化支持

05 / TRANSPARENCY

公开展示,不伪造运行证据

本页面刻意不放置伪造的成功截图、飞书聊天记录或用户转录内容。正式上线后,可在此加入经脱敏、获授权的真实测试截图,并注明测试日期与素材类型。