口播提词
录口播不必再把台词背下来。导入一份文案,点开录制,屏幕变成提词器:3 秒倒计时之后文案开始自动向上滚动,当前要念的那一句高亮,你只管看着念 —— 竖屏取景,前置摄像头直接出人像画面。
录完的视频自动进入转写队列,同一套端侧引擎接着给它上字幕;成片可以顺手存进相册。提词器的配色跟随你当前的主题皮肤,不是另搞一套界面。
主界面 · 口播提词入口
下面每一项都已经在真机上跑通。有截图的地方是 v1.3.4 的实际界面,没有截图的地方就直接写清楚它做了什么 —— 我们不用效果图凑数。
三设备速览
音落在手机、平板和 PC 上都是同一套端侧引擎 —— 屏幕变大,工作流不用从头来。
录口播不必再把台词背下来。导入一份文案,点开录制,屏幕变成提词器:3 秒倒计时之后文案开始自动向上滚动,当前要念的那一句高亮,你只管看着念 —— 竖屏取景,前置摄像头直接出人像画面。
录完的视频自动进入转写队列,同一套端侧引擎接着给它上字幕;成片可以顺手存进相册。提词器的配色跟随你当前的主题皮肤,不是另搞一套界面。
主界面 · 口播提词入口
选好音频或视频后,音落先用 VAD 把长音频切成一句一句的片段,再交给 SenseVoice-small 逐段识别。整个过程不发出任何网络请求 —— 你可以在转写开始后直接打开飞行模式,它会照常跑完。
识别结果自带时间戳,可以直接进入时间轴逐条核对,也可以先交给 AI 校对再看。
主界面 · 空态
把字幕真正压进画面,而不是生成一个需要播放器另行加载的外挂文件。烧完的视频发到任何平台都不会丢字幕,也不用担心对方播放器不支持 ASS 样式。
字体、字号、颜色、描边、位置在 App 内直接调,所见即所得。
libass 把字幕按样式绘制到每一帧画面上,与桌面端渲染同源。
ffmpeg 重新封装成视频文件,直接保存进系统相册。
这一项的产物是一段视频,静态截图说明不了什么 —— 所以这里不放图。
校对走在线大模型,默认服务商是智谱 AI,模型 GLM-4.7-Flash(含免费档)。识别结果先过一遍本地规则清洗(去重复、并短句),再把你确认过的字幕文本发给你选定的服务商,逐句返回修改建议。改前改后并排对照,满意的行一键应用,不满意的直接丢掉。
这个功能默认关闭,只有你在设置里打开并自己填好 API Key 才会联网。服务商可切换智谱、DeepSeek、Kimi、阿里云百炼与硅基流动,密钥只存在本机,用来调用你自己申请的接口。校对只在文本层发生 —— 音视频文件始终不出设备。
设置面板 · 服务商与模型
队列从首页抽出来,单独成页。待转写、转写中、已完成三种状态各归各位,一次丢进多个文件也会依次排队;中途切走做别的事,回来接着看进度。
校对、导出、烧录收进同一处,不用在页面之间来回找按钮。转写完成后直接在这里接着往下走,改完一行就能立刻看到它在成片里的样子。
同一份识别结果可以取 SRT、VTT、ASS 三种字幕格式,也可以只要一段不带时间码的纯文本。切换标签页就能预览,不必先导出再打开检查。
右边这张截图是 PC 主界面 —— SRT / VTT / ASS 标签、导出与烧录按钮都在同一屏。
PC 主界面 · SRT / VTT / ASS 标签与导出烧录入口
墨青、暮橙、月白、纯黑、纯白、幻夜、初音等共八套主题,外加 auto 跟随系统深浅色。每套都是完整的一整组配色,不是给同一个界面换个按钮颜色。还可以指定一张自己的图片做背景。
你现在看到的这个官网的青绿,就取自 App 默认主题「墨青」的主色 #35C9B5。
主题选择弹窗 · 八套主题全览
不够格单开一张大卡,但少了它们会很难受。
字体、字号、主色与描边色、边距与对齐位置逐项可调。调好的样式会同时作用于导出的 ASS 文件和烧录进画面的硬字幕。
序号、开始时间、结束时间、文本四列并排,逐条核对与修改。长音频出错时不用整段重来,改一行就行。
手机、平板、2in1 三种形态各有各的布局。宽屏上分栏并排,窄屏上纵向堆叠,不是把手机界面拉大了事。
四件用到系统的地方:碰一碰把 PC 上的文件送到手机、桌面服务卡片一眼看队列、PC 桌面快捷栏一键入口,以及字幕朗读 —— 逐句念出声,校对长文时不用一直盯着屏幕。
核心功能免费就能用。用得多了,会员把额度上限抬高。
前三次转写不限时长,随便多长的音频都行。之后单个文件上限 5 分钟,一次批量最多 3 个文件 —— 识别引擎、多格式导出、皮肤系统不设限。
会员只做一件事:抬高上面的额度上限 —— 单文件不再卡 5 分钟,批量也不再限制 3 个。转写本身仍是端侧跑的,和免费版完全一样。具体档位与金额,请在 App 内的会员页面查看。
订阅只改用量上限,不碰你的数据。转写照旧全程端侧,音视频文件不会因为它上不上传而发生任何变化 —— 这条规则对免费和会员一模一样。
这些参数放在这里,是为了让你可以自己去核对,而不是相信一句「专业级」。
| 语音识别引擎 | sherpa-onnx + SenseVoice-small |
|---|---|
| 识别模型体积 | ≈ 200 MB |
| 语音活动检测 | silero-VAD |
| AI 校对模型 | 在线大模型(默认智谱 GLM,自带 Key) |
| 校对服务商 | 智谱 AI / DeepSeek / Kimi / 阿里云百炼 / 硅基流动 |
| 音视频处理 | ffmpeg(Native C++) |
| 字幕渲染 | libass |
| 导出格式 | SRT / VTT / ASS / TXT |
| 界面框架 | ArkTS / ArkUI |
| HarmonyOS SDK | compatible SDK 6.1.0(23) |
| 支持设备 | 手机 / 平板 / 2in1 |
| 应用体积 | ≈ 200 MB(仅内置识别模型) |
| 包名 | shengluo.qinglanzhuma.huawei |
| 网络权限 | 仅在线校对时使用 |
识别模型随包内置,所以安装包比纯在线方案大;这也是识别不联网也能跑的原因。校对模型不占安装体积 —— 它在线上,只在你手动开启时工作。