17 KiB
Raw Blame History

处理转录文本

音频处理完成后Speakr 提供了丰富的工具用于查看、编辑转录文本以及与之交互。本节涵盖处理转录内容所需了解的所有内容。有关转录过程本身的信息,请参阅转录功能

理解转录视图

从侧边栏选择录音后,中心面板会显示完整的转录文本。该布局专为轻松阅读和导航而设计,对不同说话人和时间戳有清晰的视觉标识。

![Transcription View](../assets/images/screenshots/recording view with simple transcription view and chat visible.png)

说话人识别

如果您的录音启用了说话人分离功能进行处理,每位说话人的发言都会被标记上彩色标签,如 SPEAKER_01、SPEAKER_02 等。这需要配置ASR endpoint。这些标签在转录过程中自动生成,帮助您跟踪多人对话。

识别说话人

当您需要为说话人标签分配真实姓名时,点击工具栏中的说话人识别按钮。这将打开一个模态窗口,您可以在其中:

![Speaker ID Modal](../assets/images/screenshots/speaker id modal.png)

说话人识别模态窗口会展示每位检测到的说话人及其对话样本,帮助您识别他们。您可以为每位说话人输入真实姓名,这些姓名将替换转录文本中的通用标签。系统会记住这些分配以供将来参考,使在后续录音中识别相同说话人变得更加容易。

管理已保存的说话人

您识别的所有说话人都会自动保存到您的说话人数据库中。您可以通过账户设置中的专属说话人管理标签页来管理这些已保存的说话人。导航至 Account > Speakers Management 即可查看所有已保存的说话人。

![Speakers Management](../assets/images/screenshots/settings speakr management.png)

说话人管理界面以响应式网格布局显示所有已保存的说话人。每张说话人卡片显示说话人姓名、使用统计信息(包括被识别的次数、上次在录音中使用的时间以及首次添加到数据库的时间)。该界面包含内部滚动功能,可在处理大量说话人时保持标题和操作按钮始终可见。

您可以点击说话人卡片上的垃圾桶图标删除单个说话人,或使用"全部删除"按钮清空整个说话人数据库。这在维护隐私或需要以一组新说话人重新开始时非常有用。底部的说话人计数会跟踪您保存了多少说话人。

系统会利用这些已保存的说话人,在您识别新录音中的说话人时提供建议,随着您构建说话人数据库,识别过程会随时间推移变得越来越快。

编辑转录文本

Speakr 根据您处理的转录文本类型提供两种不同的编辑模式。

简单文本编辑

对于没有说话人分离的标准转录文本,点击工具栏中的编辑按钮即可进入简单文本编辑器。即使您重新生成摘要或使用聊天功能,您的编辑也会被保留。这允许您将整个转录文本作为单个文本块进行更正。您可以修正转录错误、添加标点符号、插入澄清说明以及改进格式。点击保存按钮后,您的更改将被保存。

高级 ASR 段落编辑

对于使用ASR和说话人分离处理的转录文本Speakr 提供强大的基于段落的编辑器,可保留转录文本的结构和时间信息。如果遇到说话人识别问题,请参阅故障排除

![ASR Transcription Editor](../assets/images/screenshots/edit transcript with ASR.png)

ASR 编辑器将您的转录文本呈现为段落表格,每行代表一次发言及其关联的元数据。对于每个段落,您可以:

编辑说话人姓名:每个段落显示谁在发言。您可以点击任何说话人字段进行更改,系统会提供智能下拉菜单,从您已保存的说话人数据库中推荐说话人。输入时,系统会过滤建议以帮助您快速找到正确的说话人。这对于纠正错误识别的说话人或统一整个转录文本中的说话人姓名特别有用。

调整时间戳:可以使用调整箭头微调每个段落的开始和结束时间。当自动分割不太准确时,这非常有用,允许您精确标记每个人开始和停止说话的时间。

编辑文本内容:每次发言的主要内容可以在其文本字段中直接编辑。您可以在保持段落结构的同时修正转录错误、修复语法、添加标点符号或澄清不清楚的语音。

管理段落:使用垃圾桶图标删除不应出现在转录文本中的段落(如错误检测或噪音)。如果 ASR 系统遗漏了某些内容,您还可以添加新段落,并为其设置适当的时间戳。

ASR 编辑器保持转录文本的 JSON 结构,这对于基于说话人的搜索、音频同步(点击文本跳转到音频中的对应位置)以及在气泡视图中的正确显示等功能至关重要。当您在 ASR 编辑器中保存更改时,系统会保留所有时间信息和说话人信息,同时应用您的更正。

点击"保存更改"后,您的编辑将保存到数据库。系统会维护转录文本已被手动编辑的记录,这对于质量控制和审计目的很有用。请注意,如果稍后使用完整转录重新处理功能重新处理转录文本,您的手动编辑将被覆盖。要在更新摘要的同时保留编辑,请改用仅摘要重新处理。

视图选项

转录面板提供两种显示模式以适应不同的偏好:

简单视图

默认的简单视图将转录文本呈现为带有内联说话人标签的流式文本。这种格式非常适合快速浏览内容并复制文本以供其他应用程序使用。干净的类文档外观使您能够轻松专注于内容,而不会受到视觉干扰。

气泡视图

气泡视图将转录文本格式化为类似聊天的对话形式,每位说话人的发言都在独立的消息气泡中。这种格式特别适合访谈、辩论或任何包含来回对话的录音。视觉分隔使您更容易跟踪快速交流中谁说了什么。

使用摘要功能

右侧面板中的摘要标签页包含 AI 生成的录音概述。此摘要在转录后自动创建,捕获关键点、决策和行动项。

![Summary View](../assets/images/screenshots/Summary View.png)

该摘要旨在通过突出录音中最重要的信息来节省您的时间。它通常包括讨论的主要主题、达成的关键决策或结论、行动项和分配、提及的重要日期或截止日期,以及提出的任何重大问题或担忧。

自定义摘要提示词

Speakr 提供多个级别的摘要生成自定义功能,允许您根据自身需求调整 AI 的输出。摘要提示词可以在三个不同级别进行自定义:

管理员级别:系统管理员可以设置默认的摘要提示词,适用于尚未配置自己提示词的所有用户。这在管理仪表板的 Default Prompts 下进行配置,并作为整个系统的基线。

用户级别 individual 用户可以在账户设置的自定义提示词中设置个人摘要提示词。这将覆盖管理员默认值,并应用于其所有录音,除非使用特定标签的提示词。

标签级别:每个标签都可以配置自己的自定义提示词。创建或编辑标签时,您可以指定一个摘要提示词,该提示词将用于带有该标签的任何录音。这对于不同类型的内容特别强大——例如,"法律会议"标签可能侧重于合规问题和风险因素,而"产品规划"标签可能强调功能和时间线。

提示词优先级和叠加

生成摘要时Speakr 遵循明确的优先级顺序来确定使用哪个提示词:

  1. 标签自定义提示词最高优先级如果录音带有自定义提示词的标签则这些标签优先。当多个带有自定义提示词的标签应用于同一录音时Speakr 会按标签添加的顺序智能地组合它们。这会产生复杂的叠加效果,您可以有一个基础标签如"会议"包含通用指令,然后添加修饰标签如"面向客户"或"技术讨论"来添加特定要求。提示词无缝合并,为 AI 创建全面的指令。

  2. 用户摘要提示词:如果没有标签提示词,系统将使用您在账户设置中配置的个人摘要提示词。

  3. 管理员默认提示词:当未配置标签或用户提示词时,系统回退到管理员配置的默认提示词。

  4. 系统回退如果任何级别都不存在自定义提示词Speakr 将使用内置默认值,生成关键问题、决策和行动项的章节。

摘要质量因素

生成摘要的质量取决于两个关键因素:

提示词设计:清晰指定您想要提取哪些信息的精心设计的提示词将产生更有用的摘要。考虑包含您想要的具体章节、所需的详细程度以及与您的用例相关的任何特定重点领域。

LLM 选择:您使用的 AI 模型会显著影响摘要质量。更先进的模型(如 GPT-4 或 Claude通常比小型模型产生更细致和准确的摘要。管理员可以在系统设置中配置模型在质量和成本之间取得平衡。

编辑和导出摘要

摘要可以使用与 Notes 部分类似的 Markdown 编辑器进行完全编辑。点击摘要工具栏中的编辑按钮铅笔图标进入编辑模式。Markdown 编辑器提供丰富的编辑体验,带有粗体、斜体、标题、列表、链接等格式化工具。您可以重构摘要、添加额外见解或优化 AI 生成的内容以更好地满足您的需求。更改会在输入时自动保存,确保您不会丢失编辑内容。

您可以通过多种方式导出摘要。复制按钮将整个摘要以 Markdown 格式复制到剪贴板,随时可以粘贴到电子邮件、文档或其他应用程序中。下载按钮将摘要导出为 Microsoft Word (.docx) 文件,保留格式并便于与偏好传统文档的同事共享。下载的文件使用录音标题和日期命名,便于识别。

如果需要,您可以使用不同的设置重新生成摘要,这在您想要关注内容的不同方面或对转录文本进行了重大编辑时非常有用。重新生成时,您可以临时调整标签以应用不同的提示词,而无需永久更改录音的分类。

事件提取

在您的账户设置中启用事件提取功能后Speakr 会在摘要生成过程中自动从录音中识别值得添加到日历的事件。此功能智能地检测对话中提到的会议、截止日期、预约和其他时间敏感事项。

![Event Extraction](../assets/images/screenshots/event extraction.png)

查看提取的事件

启用事件提取功能处理录音后,如果检测到任何事件,右侧面板将出现事件标签页。该标签页显示已识别事件的清晰列表,每个事件显示从对话中提取的事件标题、日期、时间和描述。事件会自动解析,具有智能日期识别功能,能够根据录音日期理解"下周二"或"两周后"等相对引用。

导出到日历

每个提取的事件都可以导出为 ICS 文件,该文件与几乎所有日历应用程序兼容,包括 Google Calendar、Outlook、Apple Calendar 和 Thunderbird。只需点击任何事件旁边的下载按钮即可将其保存为日历文件。ICS 文件包含事件标题、日期和时间,以及来自录音上下文的描述。当对话中没有提及具体时间时,事件默认设置为上午 9 点,以确保它们在您的日历中显眼显示。

启用事件提取

事件提取可以在账户设置的自定义提示词标签页中开启或关闭。启用后,系统会在您的摘要提示词中添加事件提取指令,要求 AI 在摘要生成过程中识别值得添加到日历的项目。此功能与系统中配置的任何 LLM 提供商配合使用,并适应不同的对话风格,从正式会议到非正式讨论。事件提取的质量取决于所使用的 AI 模型,更先进的模型能够更好地检测细微的调度引用。

交互式聊天

聊天标签页提供 AI 助手,可以回答有关您录音的问题。此功能对于长录音特别强大,因为在长录音中查找特定信息可能很耗时。

![Chat Interface](../assets/images/screenshots/chat view with question.png)

有效的聊天查询

AI 聊天理解上下文,可以回答有关录音的各种类型的问题。您可以询问特定信息,如"Sarah 关于预算说了什么?"或"项目的截止日期是什么时候?"AI 还可以提供分析,如"提出的主要担忧是什么?"或"总结市场团队的行动项。"

聊天在整个对话过程中保持上下文,因此您可以提出后续问题。例如,在询问预算讨论后,您可以继续提问"提出了什么解决方案?"AI 会理解您仍在讨论预算话题。

聊天最佳实践

为了在聊天功能中获得最佳效果,提问时应具体,而不是提出过于宽泛的查询。尽可能引用特定主题、人员或时间范围。如果 AI 的回答不太符合您的需求,请尝试用更多上下文重新表述您的问题。

聊天功能最适合回答录音中说了什么的事实性问题。它对于主观解释或言外之意效果较差,但可以在一定程度上识别语气和情感。

导出聊天对话

您的整个聊天对话可以导出以供将来参考或共享。聊天界面提供两种导出选项:

复制到剪贴板:点击复制按钮将整个聊天对话复制到剪贴板。这保留了问答格式,便于粘贴到电子邮件、报告或文档中。每条消息都包含一个标签,指示是来自您还是 AI 助手。

下载为 Word 文档:下载按钮将您的完整聊天记录导出为格式化的 Microsoft Word (.docx) 文件。这包括所有问题和回答,采用干净、专业的格式,便于与团队成员共享或包含在报告中。文件会自动以录音标题和导出日期命名,便于组织多个聊天导出。

当您使用聊天提取特定见解或对录音进行详细分析时,这些导出功能特别有用,允许您保存和共享发现,而无需重新创建对话。

添加和管理笔记

笔记标签页是您的个人工作空间,用于为录音添加背景和想法。这些笔记是您私有的,用您自己的见解补充转录文本。

![Notes Tab](../assets/images/screenshots/notes tab.png)

笔记支持完整的 Markdown 格式允许您创建带有标题、列表、链接和强调的结构化文档。Markdown 编辑器提供带有格式化选项的工具栏,并支持键盘快捷键以提高笔记效率。您可以在编辑和预览模式之间切换,以查看格式化后的笔记外观。

笔记的常见用途包括:

  • 对会议或对话的个人反思,这些不适合放在共享转录文本中
  • 根据讨论需要完成的后续任务
  • 关于所做决定或为何讨论某些主题的额外背景信息
  • 录音中提及的相关文档或资源的链接
  • 您想要以后研究或澄清的问题

您的笔记可以与转录文本一起进行全文搜索,这使它们对将来的参考非常有价值。您可以搜索特定术语,无论它出现在转录文本中还是您的个人笔记中都能找到。笔记会在输入时自动保存,确保您永远不会丢失想法。

复制和导出

转录文本工具栏中的复制按钮以纯文本格式将整个转录文本复制到剪贴板。这保留了段落结构,便于粘贴到文档或电子邮件中。

下载转录文本

在复制按钮旁边,您会找到下载按钮,它通过可自定义的模板提供灵活的导出选项。点击下载时,会出现一个弹出窗口,允许您从已保存的转录模板中选择或导出未格式化的原始转录文本。模板让您精确控制转录文本的格式方式,无论您需要字幕的时间戳、访谈的说话人聚焦格式,还是剧本风格的格式。您可以在账户设置中创建和管理这些模板。

如果您的录音使用 ASR 和说话人分离进行处理,导出的文本将包含说话人标识符(通用标签如 SPEAKER_01 或您已识别的实际姓名)。对于没有说话人分离的录音,转录文本将导出为连续文本。无论您是在简单视图还是气泡视图中查看转录文本,格式都保持一致——导出的文本使用底层数据的结构化格式,根据您选择的模板进行格式化。

下一步

现在您已了解如何处理转录文本,让我们探索 Speakr 强大的搜索功能——Inquire Mode它允许您使用自然语言在所有录音中进行搜索。


下一节:Inquire Mode - 语义搜索