整条链路把一篇写完的博文变成一支带配音、逐句字幕和文内配图的 1080p 视频。这个网页只开放其中的第一步:写稿。贴一篇文章进去,出一份 90–150 秒的中文口播稿 + 分镜表,可直接导出 SRT 字幕。
粘贴即用 90–150 秒口播稿 分镜表 + SRT 导出 有限试用
你花一整天写完一篇几千字的长文,发在自己的博客上。同一份内容搬到视频平台能多让几倍的人看到 —— 但"搬"这个动作的实际含义是:把书面语重写成能念出口的稿子、找个安静地方录五六分钟、剪掉口误、逐句对字幕时间、把文内插图按"讲到哪儿"切进画面、导出、起标题、写简介。一篇下来半天没了,写十篇就是一周。所以绝大多数人写完文章就算了,视频那条腿一直空着。
整条链路把上面这些压成一条命令。而其中最费脑子、也最需要你亲自把关的一步就是写稿 —— 后面的配音、排图、渲染都是机械劳动,写稿这一步决定这支片子讲得对不对、有没有人看得下去。所以把它单独拆出来放在网页上:你贴一篇文章,当场拿到稿子和分镜,读一遍改对,再决定要不要走本地那条链路出片。
中文口播按 240 字 / 分钟(合 4 字 / 秒)折算:一句的字数 = 中日韩字符数 + 中文标点数(标点计入是为了把停顿算进去)+ 每个连续的拉丁字母 / 数字串按 2 字计。每句下限 1.2 秒。总时长 > 150 秒会标红提示,< 90 秒提示偏短。这套折算只是估算,用来判稿子长短够不够,不用来对最终字幕。
画布 1920×1080,帧率 30fps,浅色底;字幕默认只显示当前这一句,句子边界按中英文句末标点切分。配图之间有 12 帧交叉淡入,展示期内画面从 1.0 缓推到 1.045 倍。
| 中文配音 | 合成 mp3,可换发音人、可调语速。稿子里的【】提示、[停顿] 这类表演标注在朗读前自动剥掉。 |
| 字级时间戳 | 时间来自语音合成时的逐词边界事件,不跑语音识别。中文词事件不带标点,脚本再按源文对齐把标点补回词的首尾。 |
| 配图 | 取文章已有的封面图与插图,不含 AI 生图;按成片时长在所有图之间均分,相邻两张交叉淡入。一张可用图都没有则拒绝出片。 |
| 渲染 | React 组件描述画面、逐帧截图再编码;换文章只换那份 JSON,不动一行前端代码。 |
| 批量 | 喂一份 slug 清单串行出片,已有成片自动跳过,失败重试一次,结尾汇总成功 / 失败数。 |
| 发布准备 | 为已渲染的片子生成上传清单(标题 / 分区 / 标签 / 简介 / 原文链接 / 片长);成片与清单条目对不上就报错退出,不会安静漏掉一支。 |
| # | 起(秒) | 止(秒) | 停留 | 帧区间 | 占比 |
|---|
| 网页版只做写稿 | 出稿子、分镜表、SRT 文本。不配音、不配图、不出 mp4 —— 那三步在本地命令行链路里。 |
| 秒数是估算 | 按 240 字 / 分钟折算,不是真实语音时长;真实时间轴由配音环节的逐词边界事件给出。 |
| 试用额度 | 共用作者本人的订阅:每 IP 每天 8 次、单次输入 4000 字符、全站每天 300 次。要绕开就填自己的 key。 |
| 吃什么 | 纯文本正文。贴网址没用 —— 本页不去抓网页,你得把正文贴进来。 |
| 本地链路吃什么 | 博客内容库里已发布文章的 slug,不是任意网址;文章必须自带配图,否则拒绝出片。 |
| 成熟度 | 孵化阶段的自用管线,不是打包好的通用软件;本地那条链路上手需要命令行环境。 |
/api/llm(消耗作者订阅的试用额度);填了 key 则由你的浏览器直连模型厂商,key 与文章内容不经过本站服务器。
本页不设账号、不记录访客信息。真实的完整成片链路是一套在本机运行的命令行工具,不在公网上。