17 KiB
Raw Permalink Blame History

录音与上传音频

Speakr 提供了两种强大的方式来向您的资料库添加内容:上传现有音频文件进行转录,或直接在浏览器中录制新音频。两种方法都包含相同的强大功能,用于组织、打标签和处理。录制完成后,您可以处理转录内容并使用AI 功能

重要提示:录制的浏览器要求

在开始录制之前,了解浏览器安全功能可能会影响您录制音频的能力非常重要,尤其是系统音频。出于安全原因,大多数浏览器要求使用 HTTPS 连接来进行音频录制功能。如果您通过本地方式访问 Speakr而非 localhost可能需要配置浏览器以允许在 HTTP 连接上进行音频录制。本页面底部提供了详细的浏览器配置说明。

录制系统音频时,您需要授予屏幕共享权限,并特别启用"同时分享系统音频"选项。如果不启用,将只能录制您的麦克风。不同浏览器对该选项的表述可能有所不同,但这是捕获电脑音频的关键。

访问新建录制界面

点击顶部导航栏中的"+ New Recording"(新建录制)按钮即可访问录制界面。这将打开一个专用屏幕,您可以在其中上传文件或开始实时录制。

![New Recording View](../assets/images/screenshots/new recording view.png)

上传音频文件

上传界面在屏幕顶部提供了一个简单的拖放区域。您可以直接从文件管理器中将音频文件拖放到此区域,或点击该区域打开文件浏览器选择文件。

Speakr 支持广泛的音频和视频格式。常见的音频格式如 MP3、WAV、M4A、FLAC、AAC 和 OGG 均可完美使用。您也可以上传视频文件,包括 MP4、MOV 和 AVISpeakr 将提取并处理音频轨道。还支持 AMR、3GP 和 3GPP 等移动端录制格式。默认文件大小限制为 500MB但管理员可以在系统设置中进行配置。对于超过 25MB 的文件使用 OpenAI 的情况,请参阅分块配置

上传文件时,它会立即出现在上传队列中,并带有显示上传状态的进度条。上传完成后,您可以添加标签、设置自定义标题,并在开始转录前配置处理选项。标签可以包含自定义 AI 提示用于专门处理。

录制实时音频

在上传区域下方,您将找到音频录制部分,包含三种不同的录制模式,每种模式针对不同的场景:

![Recording Options](../assets/images/screenshots/after recording, finalize tags and settings and notes before uploading or discard.png)

麦克风录制

红色麦克风按钮从您选择的麦克风捕获音频。此模式非常适合录制线下会议、个人语音笔记或访谈。当您点击此选项时,如果尚未授权,浏览器将请求麦克风权限。如果您连接了多个输入设备,可以选择使用哪个麦克风。

系统音频录制

蓝色系统音频按钮捕获通过电脑播放的所有声音。这非常适合录制您主要是在聆听的在线会议、网络研讨会、视频演示或电脑上播放的任何音频内容。此功能使用浏览器的屏幕捕获 API因此开始录制时需要选择要共享的屏幕或应用程序。请务必在共享对话框中勾选"分享系统音频"复选框。

组合录制(麦克风 + 系统音频)

紫色组合按钮同时将您的麦克风和系统音频录制到单一同步轨道中。这是在线会议的推荐模式(当您作为积极参与者时),因为它能捕获对话的双方。系统会智能地混合两个音频源,确保清晰录制您的声音和会议音频。

如何启用系统音频录制

当您点击录制系统音频(或同时录制麦克风和系统音频)时,浏览器会显示屏幕共享对话框。起初这可能看起来令人困惑,因为您想要录制的是音频而不是共享屏幕,但这是浏览器提供系统音频访问的方式。

从浏览器标签页录制

如果要在特定浏览器标签页中播放音频(如 YouTube 视频、基于网页的会议平台如 Google Meet 或基于浏览器的 Zoom或在线培训视频请选择标签页选项。

![Tab Selection with Audio](../assets/images/screenshots/record from tab.png)

选择标签页时,您将看到所有打开标签页的预览。选择包含音频源的标签页,然后务必在对话框底部启用**"Also share tab audio"(同时分享标签页音频)**复选框。这个复选框至关重要——如果不启用您将只能录制到静音。确切的措辞可能因浏览器而异Chrome 可能显示"Share tab audio",而 Edge 的措辞可能略有不同),但总会有一个与音频相关的复选框必须勾选。

此选项只会捕获特定标签页的音频,因此请确保在开始录制前,您感兴趣的所有音频都在该单个标签页内。

从整个屏幕录制

如果要录制的音频来自桌面应用程序或多个来源,请选择屏幕选项。

![Screen Selection Dialog](../assets/images/screenshots/record from screen.png)

这是以下录制场景的推荐选项:

  • 桌面应用程序,如 Zoom 客户端、Microsoft Teams、Skype 或 Discord
  • 来自多个浏览器标签页的同时音频
  • 您要捕获的系统声音或通知
  • 电脑上的任何音频源组合

当您选择"您的整个屏幕"时,您将看到所有可用屏幕的预览(如果您有多个显示器)。选择哪个屏幕并不重要,因为 Speakr 只录制音频,不录制视频。关键步骤是在对话框底部启用**"Also share system audio"(同时分享系统音频)**复选框。如果不启用此复选框,您将只能录制到静音。

重要 macOS 限制: "Also share system audio"选项在 Windows 和 Linux 上可用,但由于操作系统限制,在 macOS 上可能不可用。macOS 用户可能只能从浏览器标签页录制音频,而无法从整个系统或桌面应用程序录制。这是 macOS 安全模型施加的限制,而非 Speakr 或浏览器的限制。

录制期间 - 实时界面

开始录制后,界面会转换以显示活动的录制会话:

![Live Recording Interface](../assets/images/screenshots/Record mic or system audio (for online meetings) and take markdown notes.png)

实时音频监控

录制界面会为每个活动的输入源显示实时音频可视化器。使用麦克风录制时,您将看到显示语音电平的实时波形。录制系统音频时,单独的可视化器会显示电脑音频电平。这些可视化器帮助您确认音频是否被正确捕获以及电平是否适当。

顶部有一个显眼的计时器,以分钟和秒显示已录制的时长,实时更新。在计时器下方,您将看到基于当前录制时长和质量设置的文件大小估算。这有助于您了解录制将占用多少存储空间。

使用 Markdown 实时记笔记

Speakr 最强大的功能之一是在录制时进行结构化笔记。笔记区域出现在音频可视化器下方,支持完整的 Markdown 格式。

![Note Taking During Recording](../assets/images/screenshots/live recording view with notes.png)

Markdown 编辑器包含一个格式化工具栏,带有常用格式化选项的按钮,如粗体、斜体、标题、引用、列表和链接。如果您愿意,也可以直接输入 Markdown 语法。编辑器支持所有标准 Markdown 元素,使您能够创建结构良好的笔记来补充录制内容。

您的笔记会自动保存,并与录制内容关联。稍后查看录制内容时,它们会出现在 Notes笔记标签页中并且可以与转录内容一起进行全文搜索。这使得捕获音频中可能未明确表达的重要上下文、决策或行动事项变得非常容易。

实时笔记的常见用例包括:在会议期间捕获行动事项和截止日期、记录重要时间戳以便日后参考、记录参与者姓名和角色、记录决策及其理由,以及添加仅从音频中可能不清晰的上下文信息。

完成录制

停止录制或选择上传的文件后,您将看到完成界面,可以在其中添加元数据和配置处理选项:

![Upload Modal](../assets/images/screenshots/after recording, finalize tags and settings and notes before uploading or discard.png)

添加标签

标签系统是 Speakr 最强大的组织功能之一。标签显示为彩色药丸形状,您可以选择它们来对录制内容进行分类。您可以为单个录制内容应用多个标签,从而轻松在不同类别之间交叉引用内容。

![Tag Selection and Stacking](../assets/images/screenshots/tag selection and stacking.png)

在上传文件之前选择相关标签非常重要,这样在摘要生成时就会应用适当的摘要提示。每个标签可以有关联的自定义 AI 提示,这些提示会影响摘要的生成方式。例如,"会议"标签可能使摘要侧重于行动事项和决策,而"讲座"标签可能强调关键概念和学习要点。

智能提示堆叠: 当您选择多个标签时,它们关联的提示会按照您选择的顺序进行拼接,从而实现指令的智能堆叠。这个强大的功能让您能够组合通用和特定的提示。例如,您可能有一个带有通用会议指令的标准"会议"标签然后添加一个项目、客户或情境特定的标签为摘要生成添加额外的上下文和指令。AI 将通过拼接通用会议要求和特定修改来应用这两组指令。这使您能够创建复杂的摘要规则,而无需为每种可能的组合创建单独的标签。要创建和管理带有自定义提示的标签,请参阅账户设置中的标签管理

如界面所示如果您添加了包含摘要指令的标签UI 中会显示相应指示。顺序很重要——先选择主要标签,然后添加修饰标签来叠加额外的指令。标签在主视图中也是可搜索和可过滤的,方便日后查找相关录制内容。

高级 ASR 选项

如果您的管理员配置了支持说话人分离的 ASR 端点,您将看到可扩展的"高级 ASR 选项"部分。在此您可以指定转录语言(如果您的内容不是英文)、设置预期的最少和最多说话人数量以提高分离准确性,以及根据您的配置设置其他 ASR 特定选项。

这些设置对于有已知参与者的会议特别有用,因为设置准确的说话人数量可以提高 AI 在转录中分离不同声音的能力。

最终操作

在模态框底部,您有三个选项可继续操作。"Upload"(上传)或"Start Processing"(开始处理)按钮会立即使用您选择的设置开始转录。录制内容将出现在您的资料库中,并带有处理指示器,而转录在后台运行。"Discard"(丢弃)选项会删除录制内容而不保存,适用于测试录制或捕获了错误内容的情况。某些配置还可能提供"Save Draft"(保存草稿)选项,用于存储录制内容而不立即处理。

高质量录制的最佳实践

优化音频质量

转录质量始于录制质量。使用麦克风时,请找一个安静、回声和背景噪音最小的空间。柔软的家具和铺有地毯的房间通常比空旷的硬表面房间提供更好的声学效果。将麦克风保持在距离嘴部约 6-12 英寸的一致位置,并以稳定的音量说话。

手机录制的重要提示: 许多智能手机具有积极的降噪算法,旨在增强单人通话。当使用手机麦克风录制会议或多人对话时,这些降噪功能可能会错误地将其他说话人识别为背景噪音并将其过滤掉。这可能导致距离手机较远的说话人声音模糊或缺失。这不是 Speakr 的限制,而是现代手机处理音频的方式。对于多人录制,请考虑使用不带降噪功能的外部麦克风,或将手机放置在所有说话人等距的位置。

录制系统音频时,关闭可能产生通知声音或背景音频的不必要应用程序。如果录制视频通话,请确保网络连接稳定以避免音频中断。对于重要录制,使用有线网络而非 WiFi 可以提高稳定性。

同时录制麦克风和系统音频时,请使用耳机以防止回声和反馈。这确保系统音频不会被麦克风拾取,否则会造成混乱的双重录制。

从一开始就有效组织

为录制内容的命名和标签制定一致的方法。在标题中包含关键信息,如会议类型、主题或项目名称。如果原始会议日期与上传日期不同,请务必在上传时更新会议日期,使按时间排序更加容易。

在录制之前或之后立即应用标签,此时上下文在您的脑海中仍然清晰。考虑为不同类型的内容(如会议、讲座、访谈或个人笔记)创建一组标准标签。如果您的组织使用特定的项目代码或客户名称,请将这些纳入您的标签系统。

利用实时笔记功能捕获仅从音频中可能不清晰的信息。在会议开始时记录参与者姓名,在做出关键决策时标记重要时间戳,并记录任何已共享但不会在音频中捕获的视觉信息。

本地部署的浏览器配置

系统音频录制要求

系统音频录制需要特定的浏览器支持和配置。该功能在 Chrome 和其他基于 Chromium 的浏览器(如 Edge 或 Brave中效果最佳。Firefox 的支持有限,而 Safari 目前完全不支持系统音频录制。

对于使用 HTTPS 的生产部署,音频录制无需额外配置即可正常工作。但是,如果您通过 HTTP 访问 Speakrlocalhost 除外),则需要配置浏览器以允许在不安全连接上进行音频录制。

Chrome 的 HTTP 访问配置

如果您通过 HTTP非 localhost访问 SpeakrChrome 默认会阻止音频录制。要启用它:

  1. 打开 Chrome 并导航到 chrome://flags
  2. 搜索 "Insecure origins treated as secure"
  3. 在文本字段中,输入您的 Speakr URL例如 http://192.168.1.100:8899
  4. 将下拉菜单设置为 "Enabled"
  5. 点击 "Relaunch" 以使用新设置重新启动 Chrome

此配置告诉 Chrome 将您的特定 HTTP URL 视为安全连接,从而启用所有音频录制功能。

Firefox 的 HTTP 访问配置

Firefox 需要不同的方法来启用 HTTP 站点的麦克风访问:

  1. 打开 Firefox 并导航到 about:config
  2. 出现警告时点击 "Accept the Risk and Continue"(接受风险并继续)
  3. 搜索 media.devices.insecure.enabled
  4. 双击该设置将其从 false 更改为 true
  5. 重启 Firefox 使更改生效

请注意即使有此设置Firefox 的系统音频捕获也可能无法可靠工作。对于系统音频录制,强烈推荐使用 Chrome。

安全注意事项

这些浏览器配置会降低安全性,仅应用于本地开发或受信任的内部网络。对于生产部署,请务必使用带有适当 SSL 证书的 HTTPS。这确保所有浏览器功能正常工作并为用户维护安全性。

常见问题与解决方案

如果未检测到麦克风,请首先检查浏览器是否有权访问它。点击地址栏中的挂锁或信息图标,确保允许麦克风访问。验证麦克风是否正确连接并在系统设置中被选为默认输入设备。如果问题仍然存在,请尝试使用不同的浏览器或重启当前浏览器。

当系统音频录制无法工作时,最常见的问题是在选择共享内容时忘记勾选"Also share system audio"(同时分享系统音频)复选框。该复选框出现在屏幕/标签页选择对话框的底部,必须启用。确保您选择的是整个屏幕或浏览器标签页,而不是单独的应用程序窗口,因为应用程序音频共享通常不受支持。

如果您在本地托管实例上无法录制音频,请检查是否通过 HTTP 访问 Speakr。出于安全原因浏览器会阻止不安全连接上的音频录制。可以设置带有反向代理的 HTTPS或使用上述说明配置浏览器以允许在您的特定 HTTP URL 上进行音频录制。

如果录制意外停止请检查可用磁盘空间因为浏览器对本地存储有限制。确保网络连接稳定尤其是启用了自动保存功能时。检查浏览器的开发者控制台F12以查找可能表明问题的任何错误消息。

对于音频质量不佳的问题,首先检查麦克风位置和增益设置。外部 USB 麦克风通常比内置笔记本麦克风提供更好的质量。通过关闭窗户、关闭风扇和静音其他设备来减少背景噪音。如果录制系统音频,请确保源音频质量良好,因为 Speakr 无法改善劣质源音频。

继续探索

现在您已了解如何创建和上传录制内容,接下来可以探索如何处理转录内容,并利用 Speakr 的 AI 驱动功能进行摘要和对话。


下一篇:处理转录内容