> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/zh/ai/ai-whitepaper/diagrams.md).

# 图表和数据流

Zoom 的 AI 功能覆盖广泛的产品、服务和工作流，这意味着没有任何一张图可以合理地或完整地展示 AI 如何在整个 Zoom 平台上运行。不同的功能依赖不同的输入、处理路径、存储行为、模型交互和输出。有些功能只在活动交互期间处理实时的临时数据，而另一些功能会创建可保留的产物，供后续其他功能使用。有些功能完全保留在 Zoom 的第一方环境中，而另一些则依赖 Zoom 的联邦式 AI 架构，在某些情况下还会连接外部系统。为了让这一动态且广泛的系统更易于理解，本页面以一系列图表而非单一可视化模型来呈现。每张图都突出展示更大的 Zoom AI 平台中的不同层、路径或功能模式。在这些部分的底部有表格，概述哪些功能适用、它们关联的产品以及其产物保留状态。后续部分将分别探讨某些定制化产品功能，并更有针对性地解释这些特定能力如何运作。

下方的序列从一个简化的 Zoom AI 概览开始，以其最基础的形式展示平台处于以第一方为中心的状态，使用 Zoom 的标准联邦式模型架构，但尚未引入第三方商业集成或超出 Zoom 第三方 AI 模型提供商之外的外部客户数据源。从这里开始，图表逐步引入平台中更专门的部分，包括 Zoom 的 AI 方法选项、将实时音频转换为 AI 可用产物的过程，以及这些产物随后支持其他功能和工作流的方式。综合来看，这些图表旨在通过将一个高度复杂的系统拆分为更小、更易跟随的视图，来使其更易理解，并反映 Zoom 的 AI 平台不同部分在实际中的运作方式。

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/a0432f2a4e8afc7a6a2a1587dd229994c1fe40ca" alt=""><figcaption><p>Zoom AI 的简要概览</p></figcaption></figure></div>

上方的图表以简化形式展示了 Zoom 的 AI 平台，呈现平台最基础的状态之一。它说明了 Zoom 更广泛的产品和服务架构（称为 Zoom Web 后端）中的不同部分——包括会议、电话、呼叫中心、自动语音识别以及其他 Zoom 产品——如何汇入更大的 Zoom 平台，并构成可供下游 AI 功能使用的用户可访问内容主体。

这个图表中的一个核心概念是 **Zoom 用户内容**。这指的是通过用户与 Zoom 产品和服务的交互生成的内容，这些内容随后可能作为 AI 驱动体验的输入、上下文或产物。根据所涉及的产品和功能，这些内容可以包括 Zoom 聊天消息、会议摘要、转写文字、Canvas 文档、我的笔记、录制内容以及其他类似的面向用户的产物。这些材料构成了重要的上下文层，可支持后续的 AI 辅助检索、推理、摘要和跟进。

其中部分内容也可能通过检索基础设施为未来的 AI 使用做准备，例如索引检索或检索增强生成模块。在这些情况下，相关产物可以被摄取并建立索引，以便在后续的 AI 查询或处理过程中更高效地定位和使用。这有助于 Zoom AI 不仅处理实时交互，也能在整个平台上利用保留的上下文和先前由用户生成的材料。

最后，该图表还引入了 **Zoom AI** 本身作为贯穿这一更广泛生态系统的共享 AI 层。在这一简化视图中，Zoom AI 通过 Zoom 的标准联邦式方法呈现，其中 Zoom 可以在适当时使用运行在自身基础设施中的 Zoom 托管模型，以及精选的第三方 AI 模型提供商。该联邦式模型使 Zoom 能够将 AI 任务路由到最适合的可用模型环境，同时在整个平台上保持统一的 AI 体验。

## Zoom AI 服务模型方法

<div data-with-frame="true"><figure><img src="/files/0df248954a4e3e7ad0aa4884fbfaa3c820a4a355" alt=""><figcaption><p>Zoom 的 AI 方法概览，包括联邦式、ZM+ 和 ZMO</p></figcaption></figure></div>

上方的图表展示了 Zoom 的三种 AI 方法：联邦式方法、Zoom 托管模型增强版（ZM+）以及仅 Zoom 托管模型（ZMO）。它们共同代表了 Zoom 向客户提供 AI 服务的三种主要方式，每种方式在功能广度、模型灵活性和数据控制之间提供不同的平衡。

联邦式方法是 Zoom 的标准且功能最完整的方法。它允许 Zoom 与多个 AI 提供商协作，包括 Zoom 托管模型和精选的第三方模型合作伙伴，从而将任务路由到最适合该请求的模型。ZM+ 通过使用 Zoom 管理的专用模型实例提供更受控的部署模型，而 ZMO 则仅将 AI 处理保留在 Zoom 托管模型中，提供最受限制、最受控的模型路径，但功能集也更有限。

就本页面而言，后续图表通常展示联邦式方法，因为这反映了 Zoom 的标准方法以及 Zoom AI 功能的最广阔视角。使用 ZM+ 或 ZMO 的组织通常可以通过在 ذهن中移除第三方 AI 模型提供商并聚焦于流程中其余由 Zoom 管理的部分来解读这些相同图表。

更多信息请参阅 Zoom AI 模型、处理、存储和使用页面。

## 实时媒体功能和产物

<div data-with-frame="true"><figure><img src="/files/30f48891cd2fc1033c1634036785182043f24433" alt=""><figcaption><p>关于实时媒体如何转换为为 Zoom AI 功能提供支持的语音转文本数据的概览</p></figcaption></figure></div>

上方的图表说明了实时媒体交互——例如会议和电话——如何在 Zoom 平台上生成下游 AI 驱动的功能和产物。在每种情况下，实时音频都会通过与该产品或服务相关的连接点进入 Zoom。对于会议，这通常是 **多媒体路由器（MMR）**。对于电话通讯，音频通常通过 **SIP 区域**.

进入。音频被接收后，会被路由到 Zoom 的 **自动语音识别（ASR）** 服务，该服务会将实时音频转换为 **语音转文本数据**。该语音转文本数据可根据启用的设置和功能以多种方式使用。在某些情况下，它会立即作为 **实时字幕**提供给用户。在受支持的上下文中，它也可能被传递给 Zoom 的 **实时翻译** 服务，该服务会将语音转文本输出翻译为供其他语言的参会者查看的翻译字幕。

语音转文本数据还可以支持更持久或衍生的功能/特性。如果 **转写** 已启用，或者用户正在使用 **我的笔记**，ASR 服务便可在实时会话结束后生成转写文字。然而，如果未启用转写文字保留，则交互期间使用的语音转文本数据不会作为持久的转写文字保留。即便在这些情况下，Zoom AI 仍可能在会话期间临时使用该语音转文本数据以支持实时 AI 功能/特性。

例如，用户可能在 **会议内问题** 中通过 Zoom AI 提问。在这种情况下，Zoom AI 可以使用会议中的实时语音转文本数据来理解用户的问题，并生成与正在进行的对话相关的答案。

这一流程中的一个关键区别在于，仅因为会话期间使用了语音转文本数据，Zoom AI 并不一定会保留对话的转写文字。除非明确启用了转写文字保留，或者数据正通过某项功能，例如 **我的笔记**，语音转文本数据本身可能仍保持临时状态。与此同时，由该数据生成的一些下游产物可能仍会保留。例如，如果用户在会议中提问，生成的 AI 对话或相关笔记之后即使在未生成持久转写文字的情况下也可能仍可作为保留产物使用。

某些保留产物还可以成为其他下游产物和工作流的基础。例如，会议摘要、网络研讨会摘要、呼叫摘要或用户的我的笔记都可以转换为 **Zoom Canvas** 文档，在其中可以继续编辑、扩展并作为工作产物使用。反过来，这些生成的文档之后又可能作为本文件其他地方讨论的 AI 功能/特性的上下文。因此，实时音频不仅可以带来即时的 AI 功能/特性，还可以产生一连串保留的产物，持续支持 Zoom 平台上的后续 AI 辅助工作。

此图适用于以下功能/特性：

|  功能/特性  |               描述              |     产品     | 产物保留 |
| :-----: | :---------------------------: | :--------: | :--: |
|   实时字幕  |       用于实时会话的实时语音转文本字幕。       |  会议、网络研讨会  |  未保留 |
|   翻译字幕  |     根据实时语音转文字数据生成的实时翻译字幕。     |  会议、网络研讨会  |  未保留 |
|   转写文字  |       会议语音转文字内容的保留文本记录。       |    会议、电话   |  保留  |
|   会议摘要  |     AI生成的会议讨论要点、决策和待办事项摘要。    |     会议     |  保留  |
| 网络研讨会摘要 |    会议后分享的网络研讨会关键内容的AI生成摘要。    |    网络研讨会   |  保留  |
|   呼叫摘要  |      AI生成的呼叫后关键细节和待办事项摘要。     |     电话     |  保留  |
|   我的笔记  |  保留个人笔记、转写文字和会议上下文，以供日后参考和跟进。 |     会议     |  保留  |
|   跟进任务  |       基于对话详情的 AI 建议后续操作。      | Zoom Tasks |  保留  |
| 语音信箱优先级 |    基于用户定义的重要性对语音留言进行 AI 排名。   |     电话     |  保留  |
|   会议问题  |    使用实时会议上下文回答会议问题的 AI 答案。    |     会议     |  保留  |
| 网络研讨会问题 | 使用实时网络研讨会上下文回答网络研讨会问题的 AI 答案。 |    网络研讨会   |  保留  |
|   呼叫问题  |    使用实时呼叫上下文回答呼叫问题的 AI 答案。    |     电话     |  保留  |

## 录制功能

<div data-with-frame="true"><figure><img src="/files/2a90237aed2ab808af8b48a03dd5e0932294d59c" alt=""><figcaption><p>Zoom 如何处理录制内容和 AI 功能的概述</p></figcaption></figure></div>

上图说明了 Zoom AI 如何支持 **基于录制的 AI 功能** 通过在实时会议结束后对已完成的录制进行处理来实现。与其他基于音频的 Zoom 体验一样，原始媒体会通过与所使用产品相关联的基础设施进入——例如 **MMR** 用于会议，或相应的 **SIP 区域** 用于电话通讯。作为该流程的一部分，录制会被创建并发送到 Zoom 的录制服务，然后完整录制内容会存储在 Zoom 内容存储中。

一旦录制完成，与该录制相关的音频就会发送到 Zoom 的 **自动语音识别（ASR）** 转写服务。此过程会生成一份 **针对该录制的转写文字**，这可能与实时会议期间生成的语音转文字数据不同。换句话说，与已完成录制相关联的转写文字，是作为录制后处理流程的一部分生成的，而不是简单地从实时交互层复制而来。

在录制转写文字生成后，随后可以提交给 **Zoom AI** 用于进一步分析。在这一阶段，Zoom AI 会处理转写文字，以识别更高层级的录制产物，如摘要、精彩片段、章节以及对话的其他结构化表示。该分析使用 Zoom 的 AI 处理层执行，在适用情况下包括 Zoom 托管的模型，以将原始录制转写文字转换为更易使用的会后或呼叫后输出。

当该分析完成后，生成的 AI 产物会与录制本身相关联。这使得查看录制的用户不仅能看到录制内容和转写文字，还能看到额外的 AI 生成层，从而让内容更易于浏览和理解。通过这种方式，该图示展示了已完成的录制如何成为第二阶段 AI 处理的基础，生成超出原始存储媒体范围的增强型录制功能。

此图适用于以下功能/特性：

|       功能/特性      |                          描述                          |      产品     | 产物保留 |
| :--------------: | :--------------------------------------------------: | :---------: | :--: |
|       智能录制       |                 录制会议的 AI 生成精彩片段、章节和摘要                |      会议     |  保留  |
|    生成标题、描述和标签    |                 用于剪辑的 AI 生成标题、描述和标签。                 |      剪辑     |  保留  |
| 用于录音和视频的 AI 内容创作 | 使用 事件 & 活动 &直播 的录制转写文字生成书面内容，并从关键会议时刻生成由 AI 筛选的视频片段。 | Zoom Events |  保留  |

## 衍生 AI 功能

<div data-with-frame="true"><figure><img src="/files/e969f4a86f32445756a03b3bc6280051adabc3cb" alt=""><figcaption><p>Zoom 如何处理衍生 AI 内容生成功能概述</p></figcaption></figure></div>

上图说明了如何 **衍生的 AI 功能** 通过将在线用户内容用作后续 AI 辅助任务和输出的上下文来运行。在这些情况下，Zoom AI 不再只基于实时交互数据工作。相反，它会利用用户更广泛内容环境中已经存在的素材来回答问题、综合信息或帮助生成新结果。

根据任务的不同，这些上下文材料可能包含诸如聊天消息、会议摘要、我的笔记、转录文本、Zoom Canvas 文档、Zoom Slide decks、Zoom Paper 文档、Zoom Mail 或 Zoom Calendar 内容，以及由第三方连接的电子邮件或日历数据，或由用户上传的文件，以支持特定请求。通过这种方式，Zoom AI 会使用此前已创建的 Zoom 工件，并在可用时结合集成的个人级数据，以帮助实现用户所请求的最终目标。

该图还表明，这一过程本身也可以产生 **新用户内容**。例如，Zoom AI 可能会使用现有材料创建新的 Zoom 电子表格、Zoom Canvas 文档、Zoom 幻灯片演示或 Zoom Paper 文档。一旦创建，这些新对象就会成为用户更广泛内容存储库的一部分，并且之后可能再次用作未来 AI 辅助功能和工作流的上下文。这形成了一种分层推进：较早的用户内容可以支持后续输出，而这些输出又会随着时间的推移反过来成为新的上下文对象。

这种相同的模式也可能出现在其他 Zoom 界面中。在诸如以下环境中 **Zoom 中心** 或 **AI 聊天讨论小组/面板**，用户可能会在平台上提问，或与通过 Zoom 的 AI 生产力套件在线提供的文档和材料互动。在这些情况下，Zoom AI 仍然基于现有的用户可访问工件进行检索、综合、问答或后续跟进，展示了衍生 AI 功能如何将先前内容的价值延伸到新的任务和结果中。

{% hint style="info" %}
**注意**

本地用户文件上传 [可以被禁用](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

此图适用于以下功能/特性：

|     功能/特性    |                        描述                        |             产品             | 产物保留 |
| :----------: | :----------------------------------------------: | :------------------------: | :--: |
|     内容生成     | 内容生成使用 AI 通过自然语言提示来创建、优化、摘要和组织文档、演示文稿、电子表格及其他输出。 | Canvas、Sheets、Paper、Slides |  保留  |
| AI 聊天讨论小组/面板 |       用于提问、生成内容以及跨可用 Zoom 上下文工作的对话式 AI 协助。       |        AI 聊天讨论小组/面板        |  保留  |
|     提出问题     |           基于 Zoom 中心中所选文档和材料的 AI 生成答案。           |             中心             |  保留  |

## 生成式和组合特性

<div data-with-frame="true"><figure><img src="/files/f61ebf63512b5c4b6c6466d473660f84b53e173a" alt=""><figcaption><p>Zoom 如何处理生成式和组合式 AI 请求概述</p></figcaption></figure></div>

上图说明了如何 **生成和组合功能** 在 Zoom AI 平台内运行。与依赖预先存在的用户内容来帮助实现后续任务或输出的衍生式 AI 功能不同，生成式和组合式功能通常更直接地由用户的即时输入驱动。在许多情况下，这些功能并不依赖于已经存储在用户内容环境其他位置的保留 Zoom 资源。相反，它们主要由直接的用户提示、查询、上传的文件，或与当前产品体验相关的即时屏幕内容所驱动。

这种区分对于那些基于用户当前上下文中可见内容而非先前已索引或保留的工件来工作的功能尤为重要。例如，当用户总结一个聊天线程、总结一封电子邮件，或要求 Zoom AI 为一封电子邮件起草回复时，相关内容通常取自有效的客户端上下文，并打包成发送给 Zoom AI 处理的请求负载。换句话说，Zoom 不一定是从单独的服务器端存储库中检索该内容来完成任务。相反，来自有效线程、消息集合或其他可见界面上下文的相关信息会转换为文本形式，并通过 Zoom Workplace 应用提交给 Zoom AI，以便该服务执行自然语言处理、摘要或生成。

该图表还包括依赖于直接用户指令而非文本源材料的生成式用例。例如，当用户请求图像生成时，用户通过提示（prompt）描述所需输出，模型会根据该描述生成图像。在某些产品场景中，例如 Zoom Whiteboard，此图像生成可能依赖第三方 AI 模型提供商。在其他场景中，Zoom 可能使用其自托管的模型。例如，Zoom 的虚拟背景 图像生成可能依赖一个由 Zoom 托管的模型，该模型使用嵌入（embeddings）及相关处理来生成视觉输出，生成后的内容在返回给用户之前会经过审核控制。

综合来看，该图表显示，生成和组合功能往往较少依赖保留的工件，而更多依赖用户的即时意图、有效的客户端上下文或上传的支持材料。通过这种方式，它们代表了 Zoom AI 运行的另一种主要模式：不仅跨越先前内容进行检索和推理，还直接根据用户当前的请求及其周边上下文生成新的输出。

此图适用于以下功能/特性：

|    功能/特性   |                          描述                         |      产品     |    产物保留   |
| :--------: | :-------------------------------------------------: | :---------: | :-------: |
|    虚拟背景    |      使用 AI 根据用户提示创建自定义虚拟背景图像，用于 Zoom Sessions。      | 会议、活动、网络研讨会 | 保留（如果已保存） |
|    图像生成    |       使用 AI 将白板绘图或粗略的视觉素材转化为更精致、渲染过或风格化的视觉输出。       |      白板     | 保留（如果已保存） |
|    图像生成    | 使用 AI 为事件 & 活动 &直播创建品牌化图像和其他视觉素材，例如页眉、会议图像以及展会相关材料。 | 事件 & 活动 &直播 | 保留（如果已保存） |
|    内容生成    |  使用 AI 根据用户提示生成屏幕上的白板内容，例如文本、便签、表格、思维导图以及其他结构化视觉元素。 |      白板     | 保留（如果已保存） |
|    内容生成    |    使用 AI 生成书面事件 & 活动 &直播内容，例如描述、会议详情、演讲者简介和大堂公告。    | 事件 & 活动 &直播 | 保留（如果已保存） |
|  电子邮件撰写功能  |            使用 AI 起草并润色电子邮件内容，包括正文、主题行和回复。           |     电子邮件    | 保留（如果已发送） |
|    聊天撰写    |            使用 AI 根据用户提示和在线对话上下文起草并修改聊天消息。           |      聊天     | 保留（如果已发送） |
|   电子邮件摘要   |              使用 AI 总结电子邮件或电子邮件主题的关键内容。              |     电子邮件    |    未保留    |
| 消息、主题、文档摘要 |      使用 AI 总结聊天消息、对话主题以及受支持的附加文档或链接的 Canvas 内容。     |      聊天     |    未保留    |
|    智能上传    |      从上传的文件中提取事件 & 活动 &直播详情，以自动创建会议、演讲者和自定义问题。      | Zoom Events | 保留（如果已保存） |

## 我的笔记

### Zoom Meetings 中的我的笔记

<div data-with-frame="true"><figure><img src="/files/e8349a857aa8363b9a59816e4f5a84b09670d0e2" alt=""><figcaption><p>Zoom 会议中“我的笔记”数据流概述</p></figcaption></figure></div>

上图展示了在 Zoom Meetings 中，“我的笔记”如何使用会议现有的音频路径，而非依赖用户设备上存在的其他音频。在 Zoom 会议期间启用“我的笔记”后，它会访问通过会议的多媒体路由器 (MMR) 会议传输的共享会议音频。随后，Zoom 的自动语音识别 (ASR) 服务会处理该音频以生成转写文字，并将其传送到用户的设备，之后可用于支持会后生成笔记。

在此流程中，转写专门基于与该场会议相关的 Zoom 会议音频。它并非基于会议本身以外不相关的本地设备音频。会议结束后，生成的转写文字和笔记可根据用户适用的保留设置继续在线，而用于转写的底层音频在处理完成后不会被保留。

### Zoom Meetings 之外的我的笔记

<div data-with-frame="true"><figure><img src="/files/bbe3cd124aa6673f8f6a3a6d7540414fc3cdd223" alt=""><figcaption><p>Zoom Meetings 之外的 My Notes 数据流概述</p></figcaption></figure></div>

上图展示了在 Zoom Meetings 之外，My Notes 如何通过用户的本地设备音频，而不是通过共享的 Zoom Meetings 会话来运行。如果在第三方会议或线下讨论期间启用，My Notes 可以使用操作系统级别对用户麦克风的访问，以及在适用情况下对系统音频的访问，来捕获该设备上可用的本地音频。随后，这些音频会通过单用户 MMR 会议进行路由，并由 Zoom 的自动语音识别（ASR）服务处理，以生成转写文字；转写文字会传送到用户的设备，并可在之后支持会后笔记生成。

这意味着，在 Zoom Meetings 之外，转写完全基于从用户本地设备传输的音频，而不是来自共享的 Zoom Meetings 音频流。检测到设备麦克风活动时，My Notes 还可能提示用户开始新的笔记，帮助在第三方会议、基于浏览器的录制或其他麦克风活动工作流等场景中展示该功能/特性。与会议内流程一样，用于转写的音频在转写完成后不会保留，而生成的笔记和转写文字可根据适用的保留设置继续保存在用户的账户中。

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/047a862f40cd30d423dae3c7cea2b0de3ae217f0" alt=""><figcaption><p>ZoomMate 数据流概述</p></figcaption></figure></div>

上图说明了如何 **ZoomMate 在 Zoom Workplace 中充当主要工作界面**，在用户上下文、连接的知识和执行能力汇聚之处运行。ZoomMate 并不只是一个独立的助手，而是位于更广泛工作环境的中心，用户可以在其中围绕支持其日常工作的材料和系统进行搜索、推理、创建和执行。

这一角色的很大一部分来自 ZoomMate 对 **第一方 Zoom 内容**的访问。这可以包括摘要、My Notes、录制、Canvas 文档、聊天消息以及在 Zoom 平台上创建的其他用户生成材料等内容。这些内容可帮助 ZoomMate 提供所需上下文，以回答问题、综合信息、生成输出并支持后续跟进。ZoomMate 还可以使用 **记忆**，从而在帮助完成任务时纳入相关的用户偏好或工作相关细节。

该图还展示了 ZoomMate 如何通过与 **第三方知识来源**。例如，Google Drive 或 OneDrive 等已连接的云存储服务可以作为用户可访问信息的外部存储库。当这些来源集成后，Zoom 可以索引获批准的内容，以支持跨这些材料的检索，从而让 ZoomMate 能够使用 **代理式搜索** ，在 Zoom 内容和已连接的第三方知识之间协同工作。这样，ZoomMate 不仅可以搜索 Zoom 中现有的内容，还可以搜索用户有权在已连接外部平台中访问的文档和材料。

其他个人数据来源，例如 **电子邮件和日历** （不包括端到端加密电子邮件），也可以支持 ZoomMate，但它们的运作方式不同。与其被索引，这些来源通常通过直接基于 API 的检索与 ZoomMate 进行通信。这使它们非常适合用于定位相关电子邮件上下文、查看日历信息或帮助安排事件等任务，而不会将其视为更广泛文档搜索所使用的索引检索层的一部分。

该图进一步表明，ZoomMate 还可以连接到更广泛的 **第三方服务和连接器** ，这些服务和连接器既支持执行操作，也支持访问知识。这些可能包括 Jira、HubSpot、ServiceNow、Workday 以及其他已连接的商业平台。通过这些连接，ZoomMate 可以执行 **代理式任务** 代表用户执行，例如创建或更新记录、从外部服务检索信息，或在这些系统内执行其他已连接操作。这样，ZoomMate 不仅仅是一个检索和综合界面；它还充当执行层，帮助将上下文转化为行动。

同样的基础还可帮助驱动 **代理** 和 **工作流** 在 ZoomMate 环境中。代理可以使用相同的底层上下文、检索路径和已连接系统，执行更动态、基于推理的辅助，帮助用户以更高的连续性和适应性完成更广泛的多步骤任务。相比之下，工作流可以提供更结构化、可重复的自动化，使用户能够定义跨 Zoom 内容运行的重复流程，并在受支持时跨已连接的外部系统运行。这样，ZoomMate 不仅作为对话界面存在，也作为动态代理式活动和更结构化自动化的协调点。

**沙盒** 也可以支持 ZoomMate 更高级的一些执行能力。对于需要代码执行、文件生成、自动化或其他更复杂处理的任务，ZoomMate 可以使用单独的沙盒环境，而不只是依赖标准的对话处理。该沙盒运行在 Zoom 的 AWS 基础设施上，并为更高复杂度的任务提供一个短生命周期、隔离的执行层，帮助 ZoomMate 在更受控的环境中执行某些操作。这样，支持检索、推理、代理和工作流的同一套更广泛的 ZoomMate 基础，也可以在所请求的工作需要时支持更高级的任务执行。

最后，该图并未描绘出帮助驱动 ZoomMate 的所有底层组件。它没有明确显示诸如技能之类的基础能力层，或作为 Zoom AI 更广泛基础设施和设计一部分的其他支撑结构。这些元素被认为是在使 ZoomMate 行为得以实现的底层 AI 系统中运行。此图的目的在于展示 ZoomMate 作为一个统一的工作界面，在 Zoom 和已连接系统之间发挥作用所依赖的主要上下文、知识和操作界面。

### ZoomMate 第三方连接和索引

<figure><img src="/files/ea8a21da36c9240d193091be514ca65c9f049bdf" alt="" width="375"><figcaption><p>ZoomMate 连接第三方连接和数据来源概览</p></figcaption></figure>

上图说明了 ZoomMate 第三方数据架构中两个相关但不同的部分。第一部分是 ZoomMate 如何连接到受支持的第三方应用程序和服务，以便它能够在这些系统中检索信息或执行操作。第二部分是某些受支持的第三方内容来源如何被摄取并建立索引，从而使 ZoomMate 之后能够通过检索增强生成更高效地检索这些内容。

#### <mark style="color:蓝色;">ZoomMate 可以直接连接到第三方应用程序和服务</mark>

图中的一部分展示了 ZoomMate 如何连接到受支持的第三方应用程序，例如 Jira、Confluence、Salesforce、ServiceNow、Workday、云存储平台以及其他外部业务系统。这些连接使 ZoomMate 能够通过与存储业务数据或支持 Zoom 平台外运营工作的工具交互，超越 Zoom 原生内容。

这些连接通过 TLS 连接以及授权访问模型建立，例如基于 API 的集成或基于 MCP 的连接。在任何一种情况下，ZoomMate 都在所连接服务授予的权限范围内运行。这使 ZoomMate 能够从这些系统中检索相关信息，并在受支持时代表用户在这些系统中执行操作。例如，ZoomMate 可能会从 Jira 问题中检索详细信息、搜索 Confluence 页面、更新 ServiceNow 中的记录，或使用其他已连接系统作为执行更广泛任务的一部分。

这种直接连接模型对于依赖当前系统状态或实时访问第三方工具的任务尤为重要。在这些情况下，ZoomMate 可以将已连接应用程序用作一个有效的服务端点，而不仅仅是一个此前已索引内容的存储库。

#### <mark style="color:蓝色;">ZoomMate 可以索引获批准的第三方内容，以供后续检索</mark>

图中的第二部分展示了 ZoomMate 如何摄取并索引来自受支持第三方来源的内容，以便这些材料日后可作为搜索或 AI 辅助响应的一部分进行检索。此类索引检索模型最适用于已连接的内容存储库，例如云存储系统、知识库、文档平台以及其他受支持的来源，其中 ZoomMate 可能需要跨更大范围的保留外部内容进行搜索。

一旦某个受支持的来源已连接并获准用于索引，ZoomMate 就可以从该来源检索内容并将其准备好以供后续搜索。此准备过程可以包括将较大的文件或记录拆分为更小的单元，并附加诸如来源、更新时间、所有权和权限信息等元数据。然后，这些内容会写入 Zoom 的索引层，以便之后既能通过精确匹配也能通过基于语义的检索进行搜索。

当用户提交依赖于已索引第三方内容的请求时，ZoomMate 可以搜索这些已索引材料，评估哪些结果最相关，并应用与原始来源相关联的权限信息，以确保只有获授权的内容才有资格显示。随后，最相关的获授权内容会作为支持性上下文传递到 ZoomMate 的 AI 层中，用于生成响应。这样，图中展示了已索引的第三方内容如何帮助 ZoomMate 生成基于实际已连接业务材料的答案，而不仅仅依赖于通用模型知识。

## 自定义头像

### 头像创建

<div data-with-frame="true"><figure><img src="/files/901f72d5429925ea9c18c8c6c5bf04e3a4681916" alt=""><figcaption><p>自定义头像创建流程概览</p></figcaption></figure></div>

上图说明了如何根据用户录制的视频和语音创建自定义头像。流程开始时，用户会看到一段脚本，并被提示录制自己朗读该脚本。这个引导式录制步骤使 Zoom 能够捕获生成用户头像形象以及后续基于头像输出所使用的相关语音模型所需的视听素材。

在用户完成录制后，音频和视频组件会沿着不同路径进行处理。音频会发送给第三方服务，该服务会根据用户录制的语音生成语音相似度。处理完成后，第三方服务会向 Zoom 返回一个唯一的语音标识符。Zoom 将此标识符存储为用户的语音引用，以便日后在生成基于头像的剪辑或其他依赖该合成语音的受支持输出时使用。

与此同时，视频组件会发送到由 Zoom 托管的头像生成模块，在那里 Zoom 会处理录制的视觉素材，以创建用户的头像表示。这将生成一个 Zoom 存储以供未来使用的头像模板。综合来看，这两个保留的输出——存储的语音标识符和存储的头像模板——使 Zoom 能够生成未来的剪辑或基于头像的媒体，既反映用户的形象，也反映其合成语音。

### 剪辑创建

<div data-with-frame="true"><figure><img src="/files/e1893c6935b03a564669a2acc87383b5a467bb12" alt=""><figcaption><p>自定义头像剪辑创建流程概览</p></figcaption></figure></div>

上图说明了如何根据用户存储的头像和合成语音配置文件创建自定义头像剪辑。流程开始于用户上传希望头像展示的脚本。该脚本作为生成剪辑的源内容。\
\
随后，Zoom 的 Web 后端会协调创建最终输出所需的两个并行输入。首先，它会将用户存储的语音标识符与脚本一起发送给第三方语音生成服务，该服务使用用户的合成语音生成剪辑音频。其次，它会将用户存储的头像模板发送到 Zoom 的头像生成模块，以便使用用户先前创建的头像形象准备剪辑的视觉组件。\
\
一旦第三方语音生成服务生成音频，该音频就会返回给 Zoom，并传入头像生成模块。然后，头像生成模块将存储的头像模板与生成的语音音频结合起来，使头像的面部和口部动作与所说内容同步。完成口型同步和渲染过程后，Zoom 会生成最终的头像剪辑并将其交付给用户。

## 自定义词典

<div data-with-frame="true"><figure><img src="/files/4b1f07f47fa2b6221ec75df1aef3123d83d74ffc" alt=""><figcaption><p>自定义词典数据流</p></figcaption></figure></div>

上图说明了自定义词典功能如何通过向 Zoom 的自动语音识别（ASR）服务提供额外的词汇上下文，来帮助提高基于语音的 Zoom 输出的准确性。此功能旨在支持可能特定于公司、行业、团队或地区的词语、缩写、行话、产品名称或专业术语，而这些内容在转写过程中可能无法被正确识别或呈现。

流程开始于账户管理员在 Zoom Web门户中创建并存储一个自定义词典。该词典包含组织希望 Zoom 更准确识别的获批准词语或短语列表。一旦词典在账户级别保存，它就可以在受支持的会议和语音处理场景中使用。

当用户稍后开始会议时，Zoom 的 AASR 服务可以在其处理上下文中接收该账户的自定义词典。随着 ASR 服务将实时音频转换为语音转文字数据，它可以将识别到的口语与自定义词典进行比较，并尝试将识别到的声音映射到已存储的术语。这为 ASR 提供了额外指导，帮助其识别应关注哪些词语、某些术语可能如何拼写，以及缩写或专业语言应如何解释。

其结果是，初始的语音转文字输出可以更准确地反映会议中实际使用的术语。这种准确性的提升还可以传递到由对话派生的下游产物中。例如，如果之后生成会议摘要、字幕、转写文字或其他基于语音转文字数据的产物，这些输出就能更准确地反映会议期间所说的词语，从而帮助提高最终 AI 生成产物的质量和实用性。

## 自定义会议摘要模板

<div data-with-frame="true"><figure><img src="/files/992bd4a2e02878ea4a89afb4402191aa3a30e580" alt=""><figcaption><p>自定义会议摘要模板数据流</p></figcaption></figure></div>

上图说明了自定义会议摘要如何根据用户定义或账户定义的模板生成。流程始于在 Zoom 中创建并保存模板。在账户层级，管理员可以为组织用途定义自定义会议摘要模板。在个人层级，用户可以根据自己的偏好创建个人会议摘要模板。创建后，所选模板会被存储，以便在后续摘要生成时应用。

随着会议结束，Zoom AI 可以使用会议的语音转文字数据生成摘要，该摘要遵循所选自定义模板的结构和重点。如果在生成会议摘要之前已选择自定义模板，Zoom AI 会在生成摘要时直接应用该模板。这样，最终输出就能体现模板中定义的特定格式、章节或优先级，而不仅仅是默认的摘要结构。

如果在摘要首次生成之前没有选择自定义模板，那么只有在保留了会议转写文字的情况下，Zoom 才能稍后应用该模板。在这种情况下，Zoom AI 可以使用模板配置重新处理保留的转写文字，并生成与该结构一致的新摘要。然而，如果转写文字未被保留，Zoom 就没有可用于重新处理的底层转写文字，这意味着事后无法应用自定义模板。

## 个人音频隔离

<div data-with-frame="true"><figure><img src="/files/64dbca3dbd75fb2c84f1c2fd41ab95b7c6cccc9c" alt=""><figcaption><p>个人音频隔离如何隔离用户语音的概述</p></figcaption></figure></div>

上图说明了如何 **个人音频隔离** 它通过使用存储在用户设备上的本地声纹来区分用户的语音与周围背景噪音。该过程始于用户通过 Zoom Workplace 应用中的个人音频隔离功能/特性录制语音样本。该录音用于创建本地声纹，帮助应用程序识别用户的语音特征。该声纹保留在本地机器上，不会传输到 Zoom 云。

当用户之后在有环境噪音的会议中发言时，Zoom Workplace 应用会使用本地存储的声纹来帮助识别用户的语音模式，并将其与周围声音分离。这样，应用程序就能减少背景噪音，并在音频沿会议流程继续传输之前，更有效地隔离用户的声音。

因此，传输到 Zoom 云的音频是经过优化的会议音频，环境噪音已在该功能/特性支持的范围内被过滤掉。用户底层的声纹本身不会发送到 Zoom 的云基础设施。通过这种方式，个人音频隔离作为一项本地设备级处理功能/特性运行，可在清理后的音频传输到实时 Zoom 会议之前提升音频清晰度。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/zh/ai/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
