01 / Getting Started
下载、安装与授权
感谢您选择 Soundury。本手册以 Mac 设备为例,带您快速熟悉从安装到声音创作的主要流程。
下载并安装
前往下载中心获取对应系统的安装包。国内用户也可以访问 soundury.cn。下载完成后,双击安装包即可完成安装。
注册账号
您可以在程序界面或官网页面注册账号,使用邮箱即可完成注册。首次注册后会获得 14 天免费试用,试用期间可以体验软件的全部功能。
购买并激活
试用结束后按需购买授权。购买完成后,激活码会发送到您的邮箱,您可以在网页或程序内完成激活。
02 / Workspace
认识程序界面
首次打开程序,主界面由五个部分构成:顶部工具栏、左侧目录栏、中间文件列表栏、右侧详情栏和底部播放控制栏。
顶部工具栏
由 Logo、搜索框和按钮栏组成。按钮从左到右依次提供 Supertag、VST、元数据编辑、翻译元数据、AI 语音、数据库、历史、设置和用户中心。


左侧目录栏
左侧目录栏由导航栏和下方内容窗口构成,用于浏览数据库中的目录与分类。

中间文件列表栏
文件列表栏由顶部标签栏、列表标题栏和列表窗口构成,是搜索结果与素材浏览的主要区域。

右侧详情栏
展示素材图片与详情信息。选中素材后,文件路径、格式、时长和标签信息会显示在这里。

03 / First Library
开始使用
导入数据库
首次使用需要先导入音频素材并生成数据库。将素材文件夹拖动到程序界面即可开始导入,导入时间取决于磁盘读取速度和素材数量。
Logo 按钮
Soundury 的字母也集成了快捷操作:S 和 Y 分别用于折叠或展开左侧目录与右侧详情窗口;折叠两侧窗口后,可以更专注地处理文件列表。字母 O 用于快速定位当前正在播放的文件。
04 / Find Faster
搜索与 Supertag
搜索
搜索框左侧的小箭头可以打开历史下拉框,快速找到之前的搜索记录。右侧按钮是翻译搜索,开启后只需输入中文,就能搜索包含对应英文释义的素材。


Supertag
Supertag 用一个个可自定义颜色和文字的小药丸标记音频。选中音频后点击标签即可添加标记;添加后可以在大量素材中快速识别目标,也可以在 Supertag 窗口进入筛选模式,按标签查找音频。
05 / Sound Design
VST 插件
Soundury 提供 VST 插件支持。首次进入 VST 页面时点击扫描,程序会自动识别电脑中已安装的音频插件。点击插件可以试听和渲染音频,渲染完成后可选择导入到 DAW。
06 / Metadata
元数据编辑与翻译
翻译元数据功能使用 Soundury 自行训练的 AI 模型,完全在本地运行。翻译速度取决于电脑性能,首次打开时程序会提示下载模型,点击“前往设置”并下载即可。


选择字段与处理范围
安装模型后再次点击翻译元数据按钮进入界面。目前支持中英互译,未来会支持更多语言。
可翻译字段包括 Filename、Description、FXName 和 Keywords。选择字段后,再选择处理范围;数据库过大时建议选择选中目录,避免占用过多资源和时间,最后点击刷新。




开始翻译与写入
点击开始翻译后,程序会启动本地翻译。手册记录的实测结果是 10000 条数据约 2 分钟内完成,实际速度取决于电脑性能;首次启动会因为加载模型而较慢。


覆盖 Filename 不会直接让原文件名消失,原文件名会写入 filename_tr,之后仍可通过元数据编辑功能交换。译名前置或后置则会让译文和原文保留在同一字段中。
译名前置或后置会让译文和原文保留在同一字段中。


07 / AI Creation
AI 语音
首次使用:下载模型
首次打开 AI 语音如果提示下载模型,请下载 VoxCPM 和 SenseVoiceSmall。通常直接点击下载模型即可;如果下载遇到问题,可以点击浏览器下载,完成后将模型拖动到对应窗口。



模型下载完成后,再次点击 AI 语音按钮即可进入对应页面。AI 语音使用的 VoxCPM2 由面壁智能(OpenBMB)与清华大学联合研发,是开源的端到端语音生成模型。
推理性能与设备建议
- Intel Mac 只能使用 CPU 推理;可以在“设置 → AI 语音”中开启高性能模式,但功耗和风扇噪音会增加。
- M 系列 Mac 可以选择 CPU 或 GPU。内存低于 8G 时必须选择 CPU,否则可能报错。
- Windows 会自动判断显卡是否支持,不支持时默认使用 CPU 推理。


三种生成模式
极致克隆
仅需 3–10 秒的高质量参考音频,即可复刻音色、情绪和停顿。为了获得更好的效果,建议提供约 10 秒、背景干净的参考音频。
可控克隆
在保持音色相似的基础上,对内容、情感和风格进行干预。手册提示该功能目前体验仍在完善,建议谨慎使用。
声音设计
无需提供参考音频,只需输入自然语言 Prompt,模型就会从潜空间中生成匹配的声音。