功能详情

下面每一项都已经在真机上跑通。有截图的地方是 v1.3.4 的实际界面,没有截图的地方就直接写清楚它做了什么 —— 我们不用效果图凑数。

三设备速览

同一套引擎,三种屏幕

音落在手机、平板和 PC 上都是同一套端侧引擎 —— 屏幕变大,工作流不用从头来。

00 / PROMPTER

口播提词

录口播不必再把台词背下来。导入一份文案,点开录制,屏幕变成提词器:3 秒倒计时之后文案开始自动向上滚动,当前要念的那一句高亮,你只管看着念 —— 竖屏取景,前置摄像头直接出人像画面。

录完的视频自动进入转写队列,同一套端侧引擎接着给它上字幕;成片可以顺手存进相册。提词器的配色跟随你当前的主题皮肤,不是另搞一套界面。

3 秒倒计时 当前句高亮自动滚动 竖屏人像录制 录完自动进队列

主界面 · 口播提词入口

01 / ASR

端侧字幕识别

选好音频或视频后,音落先用 VAD 把长音频切成一句一句的片段,再交给 SenseVoice-small 逐段识别。整个过程不发出任何网络请求 —— 你可以在转写开始后直接打开飞行模式,它会照常跑完。

识别结果自带时间戳,可以直接进入时间轴逐条核对,也可以先交给 AI 校对再看。

sherpa-onnx SenseVoice-small silero-VAD 200MB

主界面 · 空态

02 / BURN-IN

硬字幕烧录

把字幕真正压进画面,而不是生成一个需要播放器另行加载的外挂文件。烧完的视频发到任何平台都不会丢字幕,也不用担心对方播放器不支持 ASS 样式。

01
定样式

字体、字号、颜色、描边、位置在 App 内直接调,所见即所得。

02
逐帧渲染

libass 把字幕按样式绘制到每一帧画面上,与桌面端渲染同源。

03
落盘入相册

ffmpeg 重新封装成视频文件,直接保存进系统相册。

ffmpeg libass ASS / SRT / VTT 保存到系统相册

这一项的产物是一段视频,静态截图说明不了什么 —— 所以这里不放图。

03 / PROOFREAD

AI 智能校对

校对走在线大模型,默认服务商是智谱 AI,模型 GLM-4.7-Flash(含免费档)。识别结果先过一遍本地规则清洗(去重复、并短句),再把你确认过的字幕文本发给你选定的服务商,逐句返回修改建议。改前改后并排对照,满意的行一键应用,不满意的直接丢掉。

这个功能默认关闭,只有你在设置里打开并自己填好 API Key 才会联网。服务商可切换智谱、DeepSeek、Kimi、阿里云百炼与硅基流动,密钥只存在本机,用来调用你自己申请的接口。校对只在文本层发生 —— 音视频文件始终不出设备。

在线大模型 智谱 GLM DeepSeek / Kimi 默认关闭 自带 API Key

设置面板 · 服务商与模型

最近任务

队列从首页抽出来,单独成页。待转写、转写中、已完成三种状态各归各位,一次丢进多个文件也会依次排队;中途切走做别的事,回来接着看进度。

待转写 / 转写中 / 已完成 批量排队

字幕工作区

校对、导出、烧录收进同一处,不用在页面之间来回找按钮。转写完成后直接在这里接着往下走,改完一行就能立刻看到它在成片里的样子。

校对 导出 烧录
04 / EXPORT

多格式导出

同一份识别结果可以取 SRT、VTT、ASS 三种字幕格式,也可以只要一段不带时间码的纯文本。切换标签页就能预览,不必先导出再打开检查。

右边这张截图是 PC 主界面 —— SRT / VTT / ASS 标签、导出与烧录按钮都在同一屏。

SRT VTT ASS 纯文本

PC 主界面 · SRT / VTT / ASS 标签与导出烧录入口

05 / THEME

皮肤系统

墨青、暮橙、月白、纯黑、纯白、幻夜、初音等共八套主题,外加 auto 跟随系统深浅色。每套都是完整的一整组配色,不是给同一个界面换个按钮颜色。还可以指定一张自己的图片做背景。

你现在看到的这个官网的青绿,就取自 App 默认主题「墨青」的主色 #35C9B5。

8 套主题 auto #35C9B5 自定义背景图

主题选择弹窗 · 八套主题全览

更多能力

还有这几件小事

不够格单开一张大卡,但少了它们会很难受。

ASS 自定义样式

字体、字号、主色与描边色、边距与对齐位置逐项可调。调好的样式会同时作用于导出的 ASS 文件和烧录进画面的硬字幕。

ASS v4+

字幕时间轴

序号、开始时间、结束时间、文本四列并排,逐条核对与修改。长音频出错时不用整段重来,改一行就行。

四列表格

多设备适配

手机、平板、2in1 三种形态各有各的布局。宽屏上分栏并排,窄屏上纵向堆叠,不是把手机界面拉大了事。

手机 / 平板 / 2in1

鸿蒙系统能力

四件用到系统的地方:碰一碰把 PC 上的文件送到手机、桌面服务卡片一眼看队列、PC 桌面快捷栏一键入口,以及字幕朗读 —— 逐句念出声,校对长文时不用一直盯着屏幕。

碰一碰 服务卡片 PC 快捷栏 字幕朗读
免费与会员

用多少,随你

核心功能免费就能用。用得多了,会员把额度上限抬高。

免费使用

前三次转写不限时长,随便多长的音频都行。之后单个文件上限 5 分钟,一次批量最多 3 个文件 —— 识别引擎、多格式导出、皮肤系统不设限。

前 3 次不限时长

会员

会员只做一件事:抬高上面的额度上限 —— 单文件不再卡 5 分钟,批量也不再限制 3 个。转写本身仍是端侧跑的,和免费版完全一样。具体档位与金额,请在 App 内的会员页面查看。

额度不设上限

会员不影响隐私

订阅只改用量上限,不碰你的数据。转写照旧全程端侧,音视频文件不会因为它上不上传而发生任何变化 —— 这条规则对免费和会员一模一样。

识别始终端侧
技术规格

具体用了什么

这些参数放在这里,是为了让你可以自己去核对,而不是相信一句「专业级」。

音落 v1.3.4 技术规格参数表
语音识别引擎sherpa-onnx + SenseVoice-small
识别模型体积≈ 200 MB
语音活动检测silero-VAD
AI 校对模型在线大模型(默认智谱 GLM,自带 Key)
校对服务商智谱 AI / DeepSeek / Kimi / 阿里云百炼 / 硅基流动
音视频处理ffmpeg(Native C++)
字幕渲染libass
导出格式SRT / VTT / ASS / TXT
界面框架ArkTS / ArkUI
HarmonyOS SDKcompatible SDK 6.1.0(23)
支持设备手机 / 平板 / 2in1
应用体积≈ 200 MB(仅内置识别模型)
包名shengluo.qinglanzhuma.huawei
网络权限仅在线校对时使用

识别模型随包内置,所以安装包比纯在线方案大;这也是识别不联网也能跑的原因。校对模型不占安装体积 —— 它在线上,只在你手动开启时工作。

想看它是怎么一步步变成这样的?

从一个云端 ASR 工具,到今天这个端侧优先的版本,中间只隔了一个多月。