更新日志
十四个版本,两个多月。中间有一次把已经做好的东西整个删掉重来 —— 那一次在下面标了出来。
-
口播提词修复与录屏稳定性
修掉两个影响录制的问题,并让桌面拖拽、开始转写这两条路径更顺手。
- 修复 PC 口播人像回放逆时针旋转 90° 的问题
- 修复部分手机点「开始录制」无响应:逐档尝试流组合直到可用
- 桌面拖拽文件进应用,自动开始转写
- 「开始转写」不可用时置灰,并说明原因
展开技术细节
- 口播回放镜像矩阵修正,PC 端正向输出
- 录制流组合降级链:从首选组合逐档回退,覆盖更多机型
- 拖拽落下即入队,省去一次手动点击
- 转写前置校验未通过时给出可读原因,按钮同步置灰
-
口播提词、双入口与字幕工作区
这一串把「录」也纳进了工作流:新增口播提词这个创作入口,首页拆成双入口,队列独立成页,字幕的校对 / 导出 / 烧录收进同一处。
- 新增「口播提词」:导入文案边看边录,录完自动进转写队列
- 首页重构为「处理音频 / 口播提词」两个一级入口
- 「最近任务」从首页独立成页,分待转写 / 转写中 / 已完成
- 新增字幕工作区,校对、导出、烧录集中在一处
- 硬字幕烧录修复:超宽画幅与长句换行不再溢出
- 返回键逐层收起浮层;修复提示浮层挡住点击
展开技术细节
- 提词器:3 秒倒计时 + 当前句高亮自动滚动,配色跟随主题皮肤
- 首页双入口由同一套任务模型驱动,互相可跳转
- 队列状态机独立成页,支持批量与逐条进度
- 烧录写入 ASS 内嵌样式、使用真实 PlayRes;字号改为屏幕高度百分比,长 CJK 行参与换行计算
- 浮层栈接管返回键,提示浮层 pointer-events 修正
-
里程碑 · 架构转折
AI 校对转向在线大模型:移除端侧 LLM
这一版把端侧大语言模型整个拿掉,AI 校对改为在线大模型、默认关闭、由你自带 Key;同时接入了碰一碰、字幕朗读与队列缩略图,安装包也随之瘦身。
语音识别没有动 —— 它依然全程端侧离线。变的只有校对:从「本地跑模型」改成「按需把你的字幕文本交给在线服务商」。
- 移除端侧 LLM 校对(Qwen3-1.7B / llama.cpp 随之下线),AI 校对改为在线大模型
- AI 校对改为在线大模型:默认智谱 GLM,可切 DeepSeek / Kimi / 阿里云百炼 / 硅基流动,默认关闭、自带 API Key
- 移除小艺意图接入
- 新增字幕朗读(逐句 TTS)、队列缩略图、沉浸光感
- 接入碰一碰
- 安装包瘦身
- 修复 API < 26 机型启动崩溃
展开技术细节
- 删除 llama.cpp 与 Qwen3-1.7B 校对模型的随包资源
- 校对改走在线服务商接口,密钥仅存本机
- 新增逐句 TTS 朗读、任务缩略图渲染与沉浸光感控件
- 兼容性下探,修复低版本系统启动期崩溃
-
在线大模型校对、鸿蒙系统能力与新皮肤
校对可切换在线大模型增强,接入 4 项鸿蒙原生能力,新增两套动漫皮肤,并打磨了多处体验细节。
- AI 校对支持切换在线大模型(需自备 API Key)做更强语义增强
- 接入小艺语音意图、TTS 朗读、桌面服务卡片、PC 桌面快捷栏 4 项鸿蒙系统能力(小艺意图已于 v1.2.0 移除)
- 新增「幻夜」「初音」两套动漫皮肤(带立绘)
- 录音文件禁用硬字幕烧录并给出提示
- 平板双栏布局对齐、启动页分层图标、文件队列体验优化
- 英文名由 SOUNDFALL 调整为 SOUNDDROP
展开技术细节
- 新增 CloudAiService,在线校对走标准 OpenAI 兼容接口
- 接入 WantAgent / 小艺意图框架、TTS 朗读引擎、FormExtension 服务卡片、PC 桌面快捷栏
- 动漫皮肤立绘按设计稿挂载,Q 版立绘资源随包内置
- 录音类素材识别后标记为不可烧录,引导使用外挂字幕
-
主题系统完善与界面修复
补齐主题体系的最后一块:跟随系统。同时清掉了上一版遗留的几处界面问题。
- 新增 auto 主题,跟随系统深浅色自动切换
- 修复主题选择弹窗在部分设备上的显示异常
- 修复图标渲染回归,恢复全部线性描边图标
- 完善平板与 2in1 的窗口尺寸适配
展开技术细节
- 主题状态持久化改为随应用配置存储
- 图标组件回退为内联 path,移除字体图标依赖
- 窗口断点重新校准并真机验证
-
纯黑与纯白主题上线
两套极简主题补进皮肤库,并把主题切换从设置项升级为可预览的弹窗。
- 新增纯黑、纯白两套极简主题
- 新增主题选择弹窗,5 套主题可先预览再应用
展开技术细节
- 主题令牌表扩展至 5 套完整配色
- 新增弹窗组件与预览色块渲染逻辑
-
碰一碰、两段式校对与 ASS 样式
三个方向同时推进:文件怎么进来、文本怎么变准、字幕怎么变好看。
- 支持从 PC 碰一碰把文件传到手机
- AI 校对升级为两段式流程:规则清洗 + 语义纠错
- ASS 字幕支持自定义字体、颜色、描边与位置
展开技术细节
- 接入 HarmonyOS Super Device 分布式文件接收
- 校对链路拆分为 preprocess / llm 两个阶段
- ASS 样式表参数化,与烧录管线共用同一份样式
-
皮肤系统与品牌定名
这个版本之后,它才叫「音落」。同时确立了一直用到今天的墨青主色。
- 应用正式定名「音落 SOUNDFALL」
- 上线墨青、暮橙、月白三套主题
- 支持自定义背景图
- 界面分区重组,入口按使用流程重排
展开技术细节
- 抽出独立的主题令牌层 AppTheme
- 背景图走系统相册选择,本地存储不上传
- 页面重构为「选择 → 转写 → 结果 → 输出」四段式
-
里程碑 · 架构转折
从云到端:全面转向纯离线
这一版删掉了此前所有已经做好的云端 ASR 能力 —— 接口层、鉴权、配置项,全部移除。语音识别改由 SenseVoice 在本机完成,AI 校对改由 Qwen3 在本机完成,字幕烧录改由 ffmpeg 与 libass 在本机完成。
代价是应用体积从几十兆涨到 1.2GB,首次启动需要等待模型加载。收益只有一条:从这一版起,你的素材不会再离开这台设备。
隐私不该是高级选项。它应该是默认的。
- 移除全部云端 ASR 能力与相关配置项
- 语音识别改为 SenseVoice 端侧全离线转写
- 引入 Qwen3 端侧 AI 校对
- 新增 ffmpeg + libass 硬字幕烧录
sherpa-onnx llama.cpp ffmpeg libass展开技术细节
- 删除云端接口层与鉴权模块,网络权限不再需要
- 接入 sherpa-onnx 推理运行时,模型随包内置
- 接入 llama.cpp,端侧加载 Qwen3-1.7B
- 新增原生烧录库,libass 渲染 + ffmpeg 封装
-
视觉重构
配色与图标整体重做,从这一版起界面变成了现在的样子。
- 全面改用深空暗色主题与青绿主色
- 全部图标替换为自绘线性描边
展开技术细节
- 色彩体系收敛为「单主色 + 中性灰」
- 图标由字体图标改为内联 path,描边宽度统一 1.75
-
核心功能就绪
端到端流水线第一次完整跑通:一段视频进去,一份带样式的字幕出来。
- 端侧字幕识别跑通(sherpa-onnx + SenseVoice + VAD)
- 端侧 AI 校对跑通(Qwen3-1.7B)
- 硬字幕烧录与相册保存
- 多格式导出 SRT / VTT / ASS
- 字幕时间轴四列表格
展开技术细节
- 通过 NAPI 桥接原生推理与音视频处理
- 输出模块统一为格式适配器,新增格式只需加一个适配层
- 真机验证通过
-
多设备适配与批量转写
从「能在一台设备上用」变成「在手机和 PC 上各有各的样子」。
- 手机与 PC 差异化布局
- 批量转写队列管理
- 字幕时间轴对齐编辑
展开技术细节
- 引入断点响应式布局体系
- 任务队列状态机,支持并发与中断恢复
-
鸿蒙工程奠基
从桌面原型转向鸿蒙原生,这一版是工程骨架。
- 新增鸿蒙 PC 应用工程
- 手机端小屏断点基础适配
- 修复认证相关问题
展开技术细节
- 建立 ArkTS 工程骨架与构建配置
-
项目启动
最初的形态是一个 Rust 写的云端 ASR 库加一个 Tauri 桌面原型。这条分支后来被整个废弃,但它把「音视频 → 字幕」这条流水线走通了一遍,为后面的纯端侧版本铺了路。
- Rust 云端 ASR 库
- Tauri 桌面端原型
展开技术细节
- Rust + Tauri 技术验证
- 该分支已停止维护,代码未进入 v0.6.0 之后的版本
本页的 14 条版本条目,由 30 余条开发提交按时间与语义归并而成。原始提交记录随源码保存,暂未在公开页面列出哈希。