8.7 KiB
功能特性
Speakr 将强大的转录能力与智能 AI 功能相结合,将您的音频录音转化为有价值的、可操作的知识。每个功能的设计都旨在节省时间并从您的语音内容中提取最大价值。
核心转录功能
多引擎支持
Speakr 支持多种转录引擎,以满足您的需求和预算。使用 OpenAI 的 Whisper API 进行快速、基于云的转录,并具有出色的准确率。部署 推荐的 ASR 容器 以实现说话人分离和本地处理等高级功能。有关详细设置说明,请参阅安装指南。系统会自动处理不同的音频格式,并根据需要进行转换以获得最佳转录质量。
说话人分离
使用 ASR 端点 时,Speakr 会自动识别录音中的不同说话人。如果遇到问题,请查看故障排除指南。每个说话人都会获得一个唯一标签,您可以稍后使用真实姓名进行自定义。系统会记住这些说话人档案,构建一个随时间推移不断提高识别准确率的库。在账户设置中管理您的说话人库。此功能将多人会议从大段文本转换为有组织的对话。
语言支持
使用自动检测或手动选择,转录数十种语言的内容。英语、西班牙语、法语、德语和中文等主要语言获得出色支持,准确率高。系统能优雅地处理多语言内容,在同一次录音中根据需要切换语言。
AI 驱动的智能功能
自动摘要
每条录音都会收到一个 AI 生成的摘要,捕捉关键点、决策和行动项。通过自定义提示词进行配置。用户还可以为他们的录音设置个人提示词。摘要会根据您的内容类型进行调整——技术会议获得详细的技术摘要,而非正式对话则获得更轻松的概述。自定义提示词让您可以根据特定需求调整摘要。
事件提取
在摘要处理过程中,Speakr 可以自动从录音中提取值得添加到日历的事件。在账户设置中启用后,系统会识别会议、截止日期、预约和其他时间敏感项目的提及。每个检测到的事件都可以导出为与任何日历应用程序兼容的 ICS 文件。该功能能智能解析相对日期引用,并在未提及具体时间时提供合理的默认值。在工作流程中了解更多关于使用事件提取的信息。
交互式对话
通过集成的对话功能,将静态转录稿转换为动态对话。了解如何在转录稿指南中有效使用 AI 对话。针对您的录音提问,并基于实际内容获得智能回答。请求自定义摘要、提取特定信息,或生成衍生内容如电子邮件或报告。AI 在整个对话过程中保持上下文,支持复杂的多轮交互。
语义搜索(Inquire 模式)
通过 Inquire 模式 使用自然语言问题而非关键词搜索您的所有录音。必须配置 向量存储 此功能才能工作。语义搜索理解含义和上下文,即使确切的词语不匹配也能找到相关内容。提出诸如"我们什么时候讨论过预算增加?"这样的问题,即可从任何涉及该主题的录音中获取结果,无论使用了什么特定术语。
组织与管理
标签系统
使用灵活的标签系统组织录音,超越简单的标签。标签可以包含用于专门处理的自定义 AI 提示词。每个标签可以携带自定义 AI 提示词和转录设置,根据内容类型启用自动的专业处理。标签使用颜色进行视觉组织,当同一录音应用多个标签时智能堆叠。
说话人管理
构建和维护跨录音持久的说话人档案库。每次转录后识别说话人以构建您的库。识别后,系统会在未来的录音中记住并建议这些说话人。系统跟踪使用统计信息,显示每个说话人出现的频率以及最后一次被识别的时间。批量管理工具有助于维护干净、有序的说话人库。
自定义提示词
通过多个层级的自定义提示词塑造 AI 行为。了解提示词层级以进行有效配置。个人提示词适用于您的所有录音,而特定标签的提示词会为特定内容类型激活。层级系统确保正确的提示词应用于每条录音,当多个提示词相关时智能堆叠。
分享与协作
安全分享链接
生成加密安全链接以分享录音给您 Speakr 实例之外的用户。注意分享要求。精确控制接收者看到的内容——根据需要包含或排除摘要和笔记。分享链接可在任何设备上使用,无需账户或身份验证。
导出选项
以多种格式导出录音以满足不同用途。生成包含完整转录稿、摘要和笔记的 Word 文档用于正式文档。复制格式化文本到剪贴板以便快速分享。导出单个组件如摘要或笔记用于定向分发。使用可自定义模板下载转录稿,为您的内容格式化为不同用例,从字幕到采访格式。
实时监控
从中央仪表板跟踪所有已分享的录音。查看已分享的内容、时间以及权限。修改分享设置而无需生成新链接,或在分享不再合适时立即撤销访问权限。
高级功能
音频分块
通过智能分块处理超出 API 限制的大型音频文件。查看故障排除指南获取配置详情。在 FAQ 中了解分块策略。系统自动将长录音分割为可管理的片段,分别处理,然后无缝组装结果。按持续时间或文件大小配置分块大小,以匹配您的 API 提供商的要求。
黑洞处理
设置一个监视目录,放入其中的音频文件会被自动处理。在系统设置中配置此功能以实现自动化工作流。非常适合自动化工作流或批量处理,黑洞目录会监视新文件并将其排队进行转录,无需手动干预。
自定义 ASR 配置
使用自定义 ASR 设置针对特定场景微调转录。查看 ASR 配置 获取常见设置问题。为不同会议类型设置预期说话人数量。为技术词汇或特定口音配置专用模型。通过标签系统自动应用这些设置。
用户体验
渐进式 Web 应用
将 Speakr 安装为渐进式 Web 应用,在任何设备上获得原生般的体验。PWA 在离线状态下可查看现有录音,并在恢复连接时同步。移动优化的界面确保在手机和平板电脑上流畅运行。
深色模式
通过影响每个界面元素的完整深色模式实现,减少眼睛疲劳。主题偏好在会话和设备之间持久保存,每次登录时自动应用您的选择。
响应式设计
从任何设备访问 Speakr,界面会自动适应屏幕尺寸。桌面用户获得完整的三面板布局,可同时访问录音、转录稿和对话。移动用户获得为触摸交互和小屏幕优化的简化界面。
管理控制
多用户支持
为整个团队运行单个 Speakr 实例,具有隔离的用户空间。查看用户管理了解详情。FAQ 解释了多用户架构。每个用户维护自己的录音、设置和说话人库。管理员管理用户、监控使用情况并配置系统级设置,而无需访问个人录音。
系统监控
通过全面的统计信息和指标跟踪系统健康状况。监控转录队列、存储使用情况和处理性能。识别瓶颈并根据实际使用模式优化配置。
灵活配置
通过环境变量和管理员设置配置 Speakr 的各个方面。检查系统设置获取全局配置选项。设置 API 端点、调整处理限制、启用或禁用功能,以及自定义用户体验。系统会适应您的基础设施和需求。
返回 首页 →