> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/zh-tw/ai/ai-whitepaper/diagrams.md).

# 圖表與資料流程

Zoom 的 AI 功能涵蓋廣泛的產品、服務與工作流程，這表示沒有任何單一圖示能合理或完整地呈現 AI 如何在整個 Zoom 平台上運作。不同功能依賴不同的輸入、處理路徑、儲存行為、模型互動與輸出。有些只在活動互動期間使用即時、暫時性的資料運作，而有些則會建立可保留的產物，日後可支援其他功能。有些功能完全在 Zoom 的第一方環境內運作，而有些則仰賴 Zoom 的聯邦式 AI 架構，在某些情況下還會連接外部系統。為了讓這個動態且龐大的系統更容易理解，本頁以一系列圖示呈現，而非依賴單一視覺模型。每一張圖都突顯 Zoom AI 平台中不同的層級、路徑或功能模式。這些區段底部附有表格，列出適用的功能、其所屬產品，以及其產物保留狀態。後續章節則會逐一檢視某些特定的產品功能，提供更聚焦的說明，解釋這些特定能力如何運作。

以下先以簡化概覽開始，呈現最基本形式的 Zoom AI，顯示該平台處於以第一方為核心的狀態，使用 Zoom 的標準聯邦式模型架構，但尚未引入第三方商業整合或外部客戶資料來源，僅包含 Zoom 的第三方 AI 模型供應商。接著，這些圖示會逐步引入平台中更專門的部分，包括 Zoom 的 AI 方法選項、將即時音訊轉換為可供 AI 使用的產物，以及這些產物日後如何支援其他功能與工作流程。綜合來看，這些圖示旨在將高度複雜的系統拆解為較小、較易追蹤的視圖，讓人更容易理解 Zoom 的 AI 平台各部分在實務上的運作方式。

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/bb6db41229c474b25ec115e4b101cccfc18c0db4" alt=""><figcaption><p>Zoom AI 的簡易概覽</p></figcaption></figure></div>

上方圖示以簡化形式呈現 Zoom 的 AI 平台，顯示該平台處於其中一個最基礎的狀態。它說明了 Zoom 更廣泛的產品與服務架構中不同部分（稱為 Zoom Web 後端）——包括會議、電話、聯絡中心、自動語音辨識及其他 Zoom 產品——如何匯入更大的 Zoom 平台，並貢獻可支援下游 AI 功能的使用者可存取內容。

此圖中的核心概念是 **Zoom 使用者內容**。這指的是透過使用者與 Zoom 產品和服務互動所產生的內容，日後可能作為 AI 驅動體驗的輸入、脈絡或產物。視所涉及的產品與功能而定，這些內容可能包括 Zoom 聊天訊息、會議摘要、逐字稿、Canvas 文件、我的筆記、錄製內容，以及其他類似的使用者可見產物。這些素材構成重要的脈絡層，能支援後續的 AI 輔助擷取、推理、摘要與後續處理。

其中部分內容也可能透過檢索基礎架構，例如索引式檢索或檢索增強生成模組，為未來的 AI 使用做準備。在這些情況下，相關產物可被擷取並建立索引，以便在後續的 AI 查詢或流程中更有效率地找到並使用。這有助於 Zoom AI 不僅能處理即時互動，也能在整個平台上運用保留的脈絡與先前使用者產生的素材。

最後，這張圖也介紹了 **Zoom AI** 本身作為橫跨此更廣泛生態系的共享 AI 層。在這個簡化視圖中，Zoom AI 以 Zoom 的標準聯邦式方法呈現：當任務適合時，Zoom 可同時使用在自身基礎架構內執行的 Zoom 託管模型，以及選定的第三方 AI 模型供應商。這種聯邦式模型使 Zoom 能將 AI 任務路由到最合適的可用模型環境，同時在整個平台上維持一致的 AI 體驗。

## Zoom AI 服務模型方法

<div data-with-frame="true"><figure><img src="/files/19c071db88efa5e280341319d55ce2e276610ae2" alt=""><figcaption><p>Zoom AI 方法概覽，包括聯邦式、ZM+ 與 ZMO</p></figcaption></figure></div>

上方圖示說明 Zoom 的三種 AI 方法：聯邦式方法、Zoom 托管模型加強版（ZM+），以及僅使用 Zoom 托管模型（ZMO）。這三者合在一起，代表 Zoom 提供 AI 服務給客戶的三種主要方式，各自對應不同的功能廣度、模型彈性與資料控管程度。

聯邦式方法是 Zoom 的標準且功能最完整的方法。它允許 Zoom 與多個 AI 供應商合作，包括 Zoom 托管模型與特定第三方模型合作夥伴，因此可將任務路由到最適合該請求的模型。ZM+ 透過使用由 Zoom 管理的專用模型執行個體，提供較受控的部署模型；而 ZMO 則僅將 AI 處理限制在 Zoom 托管模型內，提供最受限且最受控的模型路徑，但功能集也較有限。

就本頁而言，後續圖示通常會展示聯邦式方法，因為它反映了 Zoom 的標準方法，以及對 Zoom AI 功能最廣泛的視角。使用 ZM+ 或 ZMO 的組織，通常可以在心中移除第三方 AI 模型供應商，並聚焦於流程中剩餘由 Zoom 管理的部分來解讀這些相同圖示。

如需更多資訊，請參閱 Zoom AI 模型、處理、儲存與使用頁面。

## 即時媒體功能與產物

<div data-with-frame="true"><figure><img src="/files/c01cd2be909b9befb42215fa21d9961b4fa413e3" alt=""><figcaption><p>即時媒體如何轉換為驅動 Zoom AI 功能的語音轉文字資料概覽</p></figcaption></figure></div>

上方圖示說明即時媒體互動（例如會議與電話通話）如何在 Zoom 平台中產生下游的 AI 驅動功能與產物。在每種情況下，即時音訊都會透過與該產品或服務相關的連接點進入 Zoom。對於會議而言，這通常是 **多媒體路由器（MMR）**。對於電話，音訊通常會透過 **SIP 區域**.

一旦音訊被接收，就會被路由至 Zoom 的 **自動語音辨識（ASR）** 服務，該服務會將即時音訊轉換為 **語音轉文字資料**。這些語音轉文字資料可依啟用的設定與功能以多種方式使用。在某些情況下，它會立即以 **即時字幕**的形式提供給使用者。在支援的情境中，它也可能被傳送至 Zoom 的 **即時翻譯** 服務，該服務會將語音轉文字輸出翻譯成供其他語言參與者閱讀的翻譯字幕。

語音轉文字資料也可支援較持久或衍生的功能。如果 **逐字轉錄** 已啟用，或使用者正在使用 **我的筆記**，ASR 服務可在即時會議結束後產生逐字稿。不過，如果未啟用逐字稿保留，互動期間使用的語音轉文字資料就不會以持久逐字稿形式保留。即便在這些情況下，Zoom AI 仍可能在會議期間暫時使用語音轉文字資料，以支援即時 AI 功能。

例如，使用者可在會議中透過 Zoom AI 提出 **會議內問題** 。在這種情況下，Zoom AI 可運用會議中的即時語音轉文字資料來理解使用者的問題，並產生與進行中的對話內容相關的回答。

此流程中的一個關鍵差異是，Zoom AI 不一定因為會話中使用了語音轉文字資料，就會保留對話逐字稿。除非特別啟用逐字稿保留，或資料是透過例如 **我的筆記**等功能保留，否則語音轉文字資料本身可能仍屬暫時性。同時，從該資料產生的某些下游產物可能會持續存在。例如，若使用者在會議中提問，所產生的 AI 對話或相關筆記，即使未產生持久逐字稿，之後仍可能作為已保留的產物可供使用。

某些已保留的產物也可成為其他下游產物與工作流程的基礎。會議摘要、網路研討會摘要、通話摘要或使用者的我的筆記，都可以轉換為 **Zoom Canvas** 文件，之後可持續編輯、擴充並作為工作產物使用。進一步來說，這些產出的文件之後也可作為本文件其他部分所討論之其他 AI 功能或工作流程的脈絡。如此一來，即時音訊不僅可帶來即時 AI 功能，還可導向一連串可保留的產物，持續支援 Zoom 平台上後續的 AI 輔助工作。

此圖適用於下列功能：

|    功能    |              說明              |     產品    | 產物保留 |
| :------: | :--------------------------: | :-------: | :--: |
|   即時字幕   |        即時會話的即時語音轉文字字幕。       |  會議、網路研討會 |  未保留 |
|   翻譯字幕   |     由即時語音轉文字資料產生的即時翻譯字幕。     |  會議、網路研討會 |  未保留 |
|    逐字稿   |      會議語音轉文字內容的已保留文字紀錄。      |   會議、電話   |  已保留 |
|   會議摘要   |     AI 產生的會議重點、決策與待辦事項摘要。    |     會議    |  已保留 |
|  網路研討會摘要 |     會後產生的網路研討會重點內容 AI 摘要。    |   網路研討會   |  已保留 |
|   通話摘要   |   AI 產生的通話後摘要，整理關鍵細節與待辦事項。   |     電話    |  已保留 |
|   我的筆記   |   保留供日後參考與跟進的個人筆記、逐字稿與會議脈絡。  |     會議    |  已保留 |
|   後續任務   |      根據對話細節所建議的 AI 後續行動。     | Zoom 工作事項 |  已保留 |
| 語音信箱優先排序 |   依使用者定義的重要性進行 AI 式語音信箱排序。   |     電話    |  已保留 |
|   會議問題   |    使用即時會議脈絡回答會議問題的 AI 回答。    |     會議    |  已保留 |
|  網路研討會問題 | 使用即時網路研討會脈絡回答網路研討會問題的 AI 回答。 |   網路研討會   |  已保留 |
|   通話問答   |    使用即時通話脈絡回答通話問題的 AI 回答。    |     電話    |  已保留 |

## 錄製功能

<div data-with-frame="true"><figure><img src="/files/6522b547cf5fadf50a1a52504be692c5db490e68" alt=""><figcaption><p>Zoom 如何處理錄製內容與 AI 功能概覽</p></figcaption></figure></div>

上方圖示說明 Zoom AI 如何支援 **以錄製內容為基礎的 AI 功能** ，其運作方式是於即時會話結束後，針對已完成的錄製內容進行處理。與其他基於音訊的 Zoom 體驗相同，原始媒體會透過與所使用產品相關的基礎架構進入系統，例如會議的 **MMR** 或電話的相關 **SIP 區域** 。在此流程中，錄製內容會建立並傳送至 Zoom 的錄製服務，完成後的錄製內容則儲存在 Zoom 內容儲存區中。

錄製完成後，與該錄製相關的音訊會傳送至 Zoom 的 **自動語音辨識（ASR）** 服務進行逐字轉錄。此程序會產生 **錄製專屬逐字稿**，其內容可能不同於即時會話期間產生的語音轉文字資料。換句話說，與已完成錄製相關的逐字稿，是在錄製後處理流程中產生，而非僅僅複製自即時互動層。

在錄製逐字稿產生後，便可提交至 **Zoom AI** 以進一步分析。在此階段，Zoom AI 會處理逐字稿，以識別更高階的錄製產物，例如摘要、重點、章節，以及對話的其他結構化表示。此分析透過 Zoom 的 AI 處理層執行，包括適用時的 Zoom 托管模型，將原始錄製逐字稿轉換為更可用的會後或通話後輸出。

分析完成後，所產生的 AI 生成產物會與錄製內容本身關聯。這使得查看錄製內容的使用者不僅能看到錄製與逐字稿，還能看到額外的 AI 生成層，讓內容更容易瀏覽與理解。如此一來，這張圖示顯示已完成的錄製如何成為第二階段 AI 處理的基礎，產生超越原始已儲存媒體的強化錄製功能。

此圖適用於下列功能：

|        功能        |                   說明                   |      產品     | 產物保留 |
| :--------------: | :------------------------------------: | :---------: | :--: |
|       智慧錄製       |           為錄製會議生成 AI 重點、章節與摘要          |      會議     |  已保留 |
|    產生標題、描述與標籤    |           為片段生成 AI 標題、描述與標籤。           |      片段     |  已保留 |
| 錄製內容與影片的 AI 內容建立 | 利用活動錄製逐字稿生成書面內容，以及從關鍵會話時刻精選出的 AI 影片片段。 | Zoom Events |  已保留 |

## 衍生 AI 功能

<div data-with-frame="true"><figure><img src="/files/0dd11f75bedfed07fadad8b505633004f4d29429" alt=""><figcaption><p>Zoom 如何處理衍生 AI 內容生成功能概覽</p></figcaption></figure></div>

上方圖示說明 **衍生 AI 功能** 如何透過將可用的使用者內容作為脈絡，支援後續的 AI 輔助任務與輸出。在這些情況下，Zoom AI 不再僅依賴即時互動資料運作，而是利用使用者更廣泛內容環境中已存在的產物來回答問題、彙整資訊或協助產生新結果。

依任務不同，這些脈絡素材可能包括聊天訊息、會議摘要、我的筆記、逐字稿、Zoom Canvas 文件、Zoom Slide 簡報、Zoom Paper 文件、Zoom Mail 或 Zoom Calendar 內容、已連接的第三方電子郵件或行事曆資料，或使用者上傳以支援特定請求的檔案。如此一來，Zoom AI 會使用先前建立的 Zoom 產物，以及可用的個人層級整合資料，來協助達成使用者要求的結果。

此流程圖也反映了這個過程本身可以產生 **新的使用者內容**。例如，Zoom AI 可能會使用現有素材建立新的 Zoom Sheet、Zoom Canvas 文件、Zoom Slide 簡報或 Zoom Paper 文件。一旦建立，這些新產物就會成為使用者更廣泛內容庫的一部分，之後也可能再次作為未來 AI 輔助功能與工作流程的脈絡。這形成一種層疊式的進展：較早的使用者內容可支援較晚的輸出，而這些輸出又能隨時間成為新的脈絡產物。

同樣的模式也可在其他 Zoom 介面中出現。例如在 **Zoom Hub** 或 **AI 聊天面板**等環境中，使用者可在整個平台上提問，或與 Zoom AI 生產力套件中可用的文件與素材互動。在這些情況下，Zoom AI 再次從現有的使用者可存取產物出發，提供檢索、彙整、問答或後續處理，顯示衍生 AI 功能如何將既有內容的價值延伸至新的任務與結果。

{% hint style="info" %}
**附註**

本機使用者檔案上傳 [可停用](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

此圖適用於下列功能：

|    功能   |                      說明                     |             產品             | 產物保留 |
| :-----: | :-----------------------------------------: | :------------------------: | :--: |
|   內容生成  | 內容生成運用 AI 依自然語言提示建立、潤飾、摘要與整理文件、簡報、試算表及其他輸出。 | Canvas、Sheets、Paper、Slides |  已保留 |
| AI 聊天面板 |    透過對話式 AI 協助提問、生成內容，並跨越可用的 Zoom 脈絡進行工作。   |           AI 聊天面板          |  已保留 |
|   提出問題  |       根據 Zoom Hub 中所選文件與素材提供 AI 生成的回答。      |             Hub            |  已保留 |

## 生成與組成功能

<div data-with-frame="true"><figure><img src="/files/200a0bc6023d2676c9a7a7ec2dec57457a7eb80a" alt=""><figcaption><p>Zoom 如何處理生成與組成 AI 請求概覽</p></figcaption></figure></div>

上方圖示說明 **生成與組成功能** 在 Zoom AI 平台內運作。與依賴既有使用者內容來協助完成後續任務或輸出的衍生 AI 功能不同，生成與組成功能通常更直接由使用者的即時輸入所驅動。在許多情況下，這些功能不依賴已保留且儲存在使用者內容環境其他位置的 Zoom 產物。相反地，它們主要由直接的使用者提示、查詢、上傳檔案，或與目前產品體驗相關的即時螢幕內容所驅動。

這項區別對於從使用者目前脈絡中可見的內容運作、而非來自先前索引或保留產物的功能尤其重要。例如，當使用者總結聊天串、總結電子郵件，或請 Zoom AI 撰寫電子郵件回覆時，相關內容通常會從目前的用戶端脈絡中擷取，並封裝成要送往 Zoom AI 處理的請求負載。換句話說，Zoom 不一定是從另一個伺服器端儲存庫檢索該內容來完成任務。相反地，來自目前串流、訊息集合或其他可見介面脈絡的相關資訊，會以文字形式轉換並從 Zoom Workplace 應用程式送出至 Zoom AI，以便服務執行自然語言處理、摘要或生成。

這張圖也包含主要依賴直接使用者指令、而非文字來源素材的生成用例。例如，當使用者要求影像生成時，使用者會透過提示描述想要的輸出，而模型會依據該描述生成影像。在某些產品情境中，例如 Zoom Whiteboard，這種影像生成可能會仰賴第三方 AI 模型供應商。在其他情境中，Zoom 可能會使用自己的託管模型。例如，Zoom 的虛擬背景影像生成可仰賴一個 Zoom 托管模型，使用嵌入與相關處理來生成視覺輸出，且產生的內容會先經過審核控制，再回傳給使用者。

綜合來看，這張圖顯示生成與組成功能通常較少依賴保留的產物，而更依賴即時使用者意圖、目前用戶端脈絡或上傳的支援素材。如此一來，它們代表 Zoom AI 運作的另一大模式：不僅檢索並推理既有內容，也直接根據使用者的當前請求與周遭脈絡生成新的輸出。

此圖適用於下列功能：

|     功能    |                         說明                         |      產品     |    產物保留   |
| :-------: | :------------------------------------------------: | :---------: | :-------: |
|    虛擬背景   |        運用 AI 根據使用者提示建立自訂虛擬背景影像，供 Zoom 會議使用。        | 會議、活動、網路研討會 | 已保留（若已儲存） |
|    圖像生成   |       運用 AI 將白板繪圖或粗略視覺素材轉換為更精緻、具渲染感或風格化的視覺輸出。      |  Whiteboard | 已保留（若已儲存） |
|    圖像生成   |     運用 AI 生成活動用的品牌化影像與其他視覺素材，例如頁首、會議圖片與展區相關素材。     |      活動     | 已保留（若已儲存） |
|    內容生成   | 運用 AI 根據使用者提示生成畫面上的白板內容，例如文字、便利貼、表格、心智圖及其他結構化視覺元素。 |  Whiteboard | 已保留（若已儲存） |
|    內容生成   |         運用 AI 生成書面活動內容，例如說明、會議細節、講者簡介與大廳公告。        |      活動     | 已保留（若已儲存） |
|    郵件撰寫   |           運用 AI 擬稿與修訂電子郵件內容，包括信件內文、主旨與回覆。          |     電子郵件    | 已保留（若已傳送） |
|    聊天撰寫   |           運用 AI 根據使用者提示與可用對話脈絡起草並修訂聊天訊息。           |      聊天     | 已保留（若已傳送） |
|   電子郵件摘要  |              運用 AI 摘要電子郵件或電子郵件串的重點內容。              |     電子郵件    |    未保留    |
| 訊息、串、文件摘要 |      運用 AI 摘要聊天訊息、對話串，以及支援的附件文件或連結的 Canvas 內容。     |      聊天     |    未保留    |
|    智慧上傳   |           從上傳檔案中擷取活動細節，自動建立會議場次、講者與自訂問題。           | Zoom Events | 已保留（若已儲存） |

## 我的筆記

### Zoom 會議中的我的筆記

<div data-with-frame="true"><figure><img src="/files/de22fc4dc244bb36458a4632e1d71362e7bdec08" alt=""><figcaption><p>Zoom 會議中的我的筆記資料流程概覽</p></figcaption></figure></div>

上方圖示顯示，在 Zoom 會議中，我的筆記是使用會議既有的音訊路徑，而不是依賴使用者裝置上的其他音訊。當我的筆記在 Zoom 會議期間啟用時，它會存取透過會議的多媒體路由器（MMR）工作階段傳送的共享會議音訊。接著，該音訊會由 Zoom 的自動語音辨識（ASR）服務處理以產生逐字稿，並傳送到使用者裝置，之後可支援會後筆記生成。

在此流程中，逐字轉錄是專門基於與該會議工作階段相關的 Zoom 會議音訊，而不是基於會議本身之外、使用者裝置上的無關本機音訊。會議結束後，所產生的逐字稿與筆記可依使用者適用的保留設定保留，而用於逐字轉錄的底層音訊在處理完成後不會被保留。

### Zoom 會議之外的我的筆記

<div data-with-frame="true"><figure><img src="/files/25ffda7fb1e7f6ff30ef74e832fac82b0a32a3e7" alt=""><figcaption><p>Zoom 會議之外的我的筆記資料流程概覽</p></figcaption></figure></div>

上方圖示顯示，在 Zoom 會議之外，我的筆記是透過使用者的本機裝置音訊運作，而不是透過共享的 Zoom 會議工作階段。如果在第三方會議或面對面討論期間啟用，我的筆記可使用作業系統層級對使用者麥克風的存取，以及在適用時對系統音訊的存取，來擷取該裝置上可用的本機音訊。接著，這些音訊會經由單一使用者的 MMR 工作階段路由，並由 Zoom 的自動語音辨識（ASR）服務處理以產生逐字稿，再傳送到使用者裝置，之後可支援會後筆記生成。

這表示，在 Zoom 會議之外，逐字轉錄完全是基於從使用者本機裝置傳送的音訊，而不是來自共享的 Zoom 會議音訊串流。當偵測到裝置麥克風活動時，我的筆記也可能提示使用者開始新筆記，協助在第三方會議、瀏覽器錄製或其他麥克風啟用工作流程等情境中顯示此功能。與會內流程相同，用於逐字轉錄的音訊在轉錄完成後不會保留，而產生的筆記與逐字稿可依適用的保留設定保存在使用者帳戶中。

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/fa5068c47c07706303d7432408d0412c5aa07a22" alt=""><figcaption><p>ZoomMate 資料流程概覽</p></figcaption></figure></div>

上方圖示說明 **ZoomMate 作為 Zoom Workplace 中的主要工作介面**，運作於使用者脈絡、連結知識與執行能力匯聚的交會點。ZoomMate 不僅僅是獨立助理，而是位於更廣泛工作環境的中心，使用者可在其中跨越支援日常工作的素材與系統進行搜尋、推理、建立與執行。

這項角色的重要部分來自 ZoomMate 對 **第一方 Zoom 內容**的存取。這可包括在 Zoom 平台上建立的摘要、我的筆記、錄製內容、Canvas 文件、聊天訊息與其他使用者產生的素材。這些產物可為 ZoomMate 提供回答問題、整合資訊、生成輸出與支援後續處理所需的脈絡。ZoomMate 也可使用 **記憶**，使其在協助完成任務時能納入相關的使用者偏好或工作細節。

圖示也顯示，ZoomMate 會透過整合 **第三方知識來源**，而延伸至 Zoom 原生內容之外。例如，連接的雲端儲存服務如 Google Drive 或 OneDrive 可作為使用者可存取資訊的外部儲存庫。當這些來源完成整合時，Zoom 可索引已核准內容，以支援跨這些素材的檢索，讓 ZoomMate 能使用 **代理式搜尋** 在 Zoom 內容與連結的第三方知識之間進行工作。如此一來，ZoomMate 不僅能搜尋 Zoom 內部存在的內容，也能跨使用者有權存取的連結外部平台文件與素材進行搜尋。

其他個人資料來源，例如 **電子郵件與行事曆** （不含端對端加密電子郵件），也可支援 ZoomMate，但其運作方式不同。這些來源通常不會被索引，而是透過直接以 API 為基礎的擷取與 ZoomMate 通訊。這使它們適合用於尋找相關電子郵件脈絡、檢視行事曆資訊，或協助排程活動，而不會將其視為用於更廣泛文件搜尋的索引檢索層的一部分。

圖示也進一步反映，ZoomMate 可連接更廣泛的 **第三方服務與連接器** ，同時支援知識存取與執行操作。這些可能包括 Jira、HubSpot、ServiceNow、Workday，以及其他已連接的商務平台。透過這些連接，ZoomMate 可執行 **代理式任務** ，例如代表使用者建立或更新記錄、從外部服務擷取資訊，或在這些系統中執行其他連接式操作。這使 ZoomMate 不僅僅是一個檢索與整合介面；它也作為一個執行層，協助把脈絡轉化為行動。

這個相同的基礎也有助於支援 ZoomMate 環境中的 **代理** 與 **工作流程** 。代理可使用相同的底層脈絡、檢索路徑與連接系統，提供更動態、以推理為基礎的協助，幫助使用者以更高的連續性與適應性完成更廣泛的多步驟任務。相較之下，工作流程可提供更結構化且可重複的自動化，讓使用者定義可跨 Zoom 內容、以及在支援時跨連接的外部系統運作的重複流程。如此一來，ZoomMate 不僅作為對話式介面，也作為動態代理式活動與較結構化自動化的協調點。

**Sandbox** 也可支援 ZoomMate 的某些更進階執行能力。對於需要程式碼執行、檔案生成、自動化或其他更複雜處理的任務，ZoomMate 可使用獨立的沙箱環境，而不只是依賴標準對話處理。此沙箱在 Zoom 的 AWS 基礎架構上執行，並提供短暫、隔離的高複雜度任務執行層，協助 ZoomMate 以更受控的環境完成某些操作。如此一來，支援檢索、推理、代理與工作流程的同一個更廣泛 ZoomMate 基礎，也能在所需工作具備相應需求時，支援更進階的任務執行。

最後，這張圖未描繪所有支援 ZoomMate 的底層元件。它並未明確呈現技能等基礎能力層，或其他屬於 Zoom AI 更廣泛基礎架構與設計的支援結構。這些元素被視為在支援 ZoomMate 行為的底層 AI 系統中運作。這張圖的目的則是展示 ZoomMate 作為跨 Zoom 與連接系統的統一工作介面時，所依賴的主要脈絡、知識與行動面。

### ZoomMate 第三方連線與索引

<figure><img src="/files/429a255e6e7fab511dde0d6baa0e501f28a78316" alt="" width="375"><figcaption><p>ZoomMate 如何連接第三方連線與資料來源概覽</p></figcaption></figure>

上方圖示說明 ZoomMate 第三方資料架構中兩個相關但不同的部分。第一部分是 ZoomMate 如何連接受支援的第三方應用程式與服務，以便在那些系統中擷取資訊或採取行動。第二部分則是某些受支援的第三方內容來源如何被擷取與索引，以便 ZoomMate 日後能透過檢索增強生成更有效率地檢索這些內容。

#### <mark style="color:藍色;">ZoomMate 可直接連接第三方應用程式與服務</mark>

圖中的一部分顯示 ZoomMate 如何連接受支援的第三方應用程式，例如 Jira、Confluence、Salesforce、ServiceNow、Workday、雲端儲存平台，以及其他外部商務系統。這些連線使 ZoomMate 能超越 Zoom 原生內容，與儲存商務資料或支援 Zoom 平台外營運工作的工具互動。

這些連線透過 TLS 連線，並經由授權存取模型建立，例如以 API 為基礎的整合或以 MCP 為基礎的連線。無論是哪一種方式，ZoomMate 都會在連線服務所授予的權限範圍內運作。這讓 ZoomMate 能從那些系統擷取相關資訊，且在支援的情況下，代表使用者在其中採取行動。例如，ZoomMate 可擷取 Jira 問題的詳細資訊、搜尋 Confluence 頁面、更新 ServiceNow 中的記錄，或將其他連線系統作為執行更大任務的一部分。

這種直接連線模型對於依賴目前系統狀態或即時存取第三方工具的任務尤其重要。在這些情況下，ZoomMate 可將連線應用程式作為主動服務端點，而不只是先前已索引內容的儲存庫。

#### <mark style="color:藍色;">ZoomMate 可索引已核准的第三方內容供日後擷取</mark>

圖中的另一部分顯示 ZoomMate 如何擷取並索引來自受支援第三方來源的內容，使這些素材日後可作為搜尋或 AI 輔助回應的一部分被擷取。這種索引式檢索模型最適用於連接的內容儲存庫，例如雲端儲存系統、知識庫、文件平台及其他受支援來源，當 ZoomMate 需要跨較大量已保留的外部內容搜尋時尤其重要。

一旦某個受支援來源連線並核准索引，ZoomMate 就可從該來源擷取內容並為日後搜尋做準備。這個準備程序可能包括將較大的檔案或記錄拆分成較小單元，並附加來源、更新時間、擁有者與權限資訊等中繼資料。接著，這些內容會寫入 Zoom 的索引層，以便日後可透過精確比對與語意式檢索進行搜尋。

當使用者提出依賴索引式第三方內容的請求時，ZoomMate 可搜尋這些已索引素材、評估哪些結果最相關，並套用與原始來源相關的權限資訊，確保只有獲授權的內容才有資格顯示。最相關且已授權的內容之後可作為支援脈絡傳送至 ZoomMate 的 AI 層。如此一來，這張圖顯示索引式第三方內容如何幫助 ZoomMate 提供以實際連結商務素材為基礎的答案，而不只是依賴一般模型知識。

## 自訂虛擬人偶

### Avatar 建立

<div data-with-frame="true"><figure><img src="/files/b97d86682a4545ba2cc9569629ca071124185c2f" alt=""><figcaption><p>自訂 Avatar 建立流程概覽</p></figcaption></figure></div>

上方圖示說明如何根據使用者錄製的影片與聲音建立自訂 Avatar。流程開始於向使用者顯示一段腳本，並提示其錄製自己朗讀腳本。這個引導式錄製步驟可讓 Zoom 擷取生成使用者 Avatar 外貌，以及日後 Avatar 型輸出所用相關語音模型所需的影音素材。

使用者完成錄製後，音訊與影片元件會透過不同路徑處理。音訊會傳送至第三方服務，根據使用者錄製的語音生成聲音外貌。處理完成後，第三方服務會將唯一的聲音識別碼回傳給 Zoom。Zoom 會將此識別碼儲存為使用者的聲音參考，以便日後生成 Avatar 片段或其他依賴該合成聲音的受支援輸出時使用。

同時，影片元件會傳送至 Zoom 托管的 Avatar 生成模組，在該處 Zoom 會處理錄製的視覺素材，以建立使用者的 Avatar 表現。這會產生一個 Avatar 範本，供 Zoom 日後使用。綜合這兩個已保留的輸出——儲存的聲音識別碼與儲存的 Avatar 範本——即可讓 Zoom 生成未來的片段或 Avatar 型媒體，呈現使用者的外貌與其合成聲音。

### 片段建立

<div data-with-frame="true"><figure><img src="/files/82624672aa4a2a1666641536a30664d1182519f2" alt=""><figcaption><p>自訂 Avatar 片段建立流程概覽</p></figcaption></figure></div>

上方圖示說明如何根據使用者儲存的 Avatar 與合成聲音設定檔建立自訂 Avatar 片段。流程開始於使用者上傳希望 Avatar 呈現的腳本。該腳本作為生成片段的來源內容。\n\n接著，Zoom 的 Web 後端會協調建立最終輸出所需的兩個平行輸入。首先，它會將使用者儲存的聲音識別碼與腳本一起傳送至第三方語音生成服務，由該服務使用使用者的合成聲音產生片段音訊。其次，它會將使用者儲存的 Avatar 範本傳送至 Zoom 的 Avatar 生成模組，以便使用先前建立的使用者 Avatar 外貌來準備片段的視覺元件。\n\n一旦第三方語音生成服務產生音訊，該音訊便會回傳給 Zoom，並送入 Avatar 生成模組。接著，Avatar 生成模組會將儲存的 Avatar 範本與生成的語音音訊結合，讓 Avatar 的臉部與嘴部動作與說話內容同步。當這個嘴型同步與渲染程序完成後，Zoom 會產出完成的 Avatar 片段並將其傳送回使用者。

## 自訂字典

<div data-with-frame="true"><figure><img src="/files/6905064d4563779ec0de03446f0f780e1f057d27" alt=""><figcaption><p>自訂字典資料流程</p></figcaption></figure></div>

上方圖示說明自訂字典功能如何透過為 Zoom 的自動語音辨識（ASR）服務提供額外的詞彙脈絡，來提升語音型 Zoom 輸出的準確性。此功能旨在支援可能屬於公司、產業、團隊或地區特有的字詞、縮寫、行話、產品名稱或專門術語，並改善其在轉錄中可能無法正確辨識或呈現的問題。

流程開始於帳戶管理員在 Zoom 網頁入口網站中建立並儲存自訂字典。該字典包含組織希望 Zoom 更準確辨識的核准字詞或片語清單。一旦字典在帳戶層級儲存完成，即可在受支援的會議與語音處理情境中使用。

當使用者之後開始會議時，Zoom 的 AASR 服務可將該帳戶的自訂字典納入其處理脈絡中。當 ASR 服務將即時音訊轉換為語音轉文字資料時，它可將感知到的語音與自訂字典進行比對，並嘗試把辨識出的聲音對應到已儲存的詞彙。這會為 ASR 提供更多指引，告訴它要尋找哪些字詞、某些術語可能如何拼寫，以及縮寫或專門語言應如何解讀。

因此，初始的語音轉文字輸出能更準確反映會議中實際使用的術語。這種更高的準確度也可延伸至從對話衍生出的下游產物。例如，如果之後產生會議摘要、字幕、逐字稿或其他以語音轉文字資料為基礎的資產，這些輸出可反映對會議中所說字詞更準確的呈現，進而提升最終 AI 生成產物的品質與實用性。

## 自訂會議摘要範本

<div data-with-frame="true"><figure><img src="/files/eeee69041d37a14b4c28a803a33e7a43eec5c280" alt=""><figcaption><p>自訂會議摘要範本資料流程</p></figcaption></figure></div>

上方圖示說明自訂會議摘要如何根據使用者定義或帳戶定義的範本產生。流程開始於在 Zoom 中建立並儲存範本。於帳戶層級，管理員可為組織用途定義自訂會議摘要範本。於個人層級，使用者可依自己的偏好建立個人會議摘要範本。建立完成後，所選範本會被儲存，以便之後摘要生成時套用。

當會議結束時，Zoom AI 可使用該會議的語音轉文字資料，依所選自訂範本的結構與重點生成摘要。如果在會議摘要產生之前就已選定自訂範本，Zoom AI 會在產生摘要時直接套用該範本。這使得最終輸出能反映範本所定義的特定格式、區段或優先順序，而不只是預設摘要結構。

如果在摘要首次生成前未選擇自訂範本，只有在會議逐字稿被保留的情況下，Zoom 才能稍後套用該範本。在這種情況下，Zoom AI 可使用該範本的設定重新處理已保留的逐字稿，並產生與該結構一致的新摘要。但如果逐字稿未被保留，Zoom 就無法取得可重新處理的底層逐字稿，因此事後便無法套用自訂範本。

## 個人音訊隔離

<div data-with-frame="true"><figure><img src="/files/90f57d33c3a881b9277f7b72d291f6c702c1da22" alt=""><figcaption><p>Personal Audio Isolation 如何將使用者的聲音與其他聲音分離的概覽</p></figcaption></figure></div>

上方圖示說明 **個人音訊隔離** 其運作方式是使用儲存在使用者裝置本機上的聲音特徵來區分使用者的語音與周遭背景噪音。當使用者透過 Zoom Workplace 應用程式中的 Personal Audio Isolation 功能錄製一段聲音樣本時，流程便會開始。該錄音會用來建立一個本機聲音特徵，協助應用程式辨識使用者的聲音特性。這個聲音特徵會保留在本機上，不會傳送到 Zoom 雲端。

之後，當使用者在具有環境噪音的環境中於會議期間發言時，Zoom Workplace 應用程式會使用這個本機儲存的聲音特徵，協助辨識使用者的語音模式，並將其與周遭聲音分離。如此一來，應用程式便能在音訊傳送到會議流程的後續之前，更有效地降低背景噪音並隔離使用者的聲音。

因此，傳送到 Zoom 雲端的音訊是經過調整、並已在此功能支援範圍內過濾掉環境噪音的會議音訊。使用者底層的聲音特徵本身不會傳送至 Zoom 的雲端基礎架構。透過這種方式，Personal Audio Isolation 可作為一項在本機裝置層級進行處理的功能，在乾淨音訊傳送到即時 Zoom 工作階段之前提升音訊清晰度。


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/zh-tw/ai/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
