> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/pt/ai-whitepaper/diagrams.md).

# Diagramas e Fluxos de Dados

As capacidades de IA da Zoom abrangem uma ampla variedade de produtos, serviços e fluxos de trabalho, o que significa que nenhum diagrama consegue, de forma razoável ou completa, captar como a IA funciona em toda a plataforma Zoom. Diferentes recursos dependem de diferentes entradas, caminhos de processamento, comportamentos de armazenamento, interações entre modelos e saídas. Alguns operam apenas com dados vivos e efémeros durante uma interação ativa, enquanto outros criam artefatos retidos que podem mais tarde apoiar recursos adicionais. Algumas funções permanecem inteiramente no ambiente próprio da Zoom, enquanto outras dependem da arquitetura federada de IA da Zoom e, em alguns casos, de sistemas externos conectados. Para tornar este sistema dinâmico e expansivo mais fácil de entender, esta página apresenta uma série de diagramas em vez de depender de um único modelo visual. Cada um destaca uma camada, um percurso ou um padrão de recurso diferente dentro da plataforma Zoom AI mais ampla. Na parte inferior destas secções existem tabelas que indicam quais os recursos aplicáveis, o produto associado e o respetivo estado de retenção de artefatos. Mais à frente, as secções analisam então certos recursos específicos do produto individualmente, oferecendo explicações mais focadas sobre como essas capacidades específicas funcionam.

A sequência começa abaixo com uma visão geral simplificada do Zoom AI na sua forma mais básica, mostrando a plataforma num estado centrado na própria Zoom que usa a arquitetura padrão de modelo federado da Zoom, mas ainda não introduz integrações empresariais de terceiros nem fontes externas de dados de clientes, para além dos fornecedores de modelos de IA de terceiros da Zoom. A partir daí, os diagramas introduzem gradualmente partes mais especializadas da plataforma, incluindo as opções da abordagem de IA da Zoom, a transformação de áudio em direto em artefatos utilizáveis por IA e as formas como esses artefatos podem mais tarde apoiar outros recursos e fluxos de trabalho. Em conjunto, estes diagramas pretendem tornar um sistema altamente complexo mais acessível, dividindo-o em vistas mais pequenas e fáceis de seguir que refletem como diferentes partes da plataforma Zoom AI funcionam na prática.

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/990e29ac5917c319f2503017bee61d0705641c30" alt=""><figcaption><p>Uma visão geral simples do Zoom AI</p></figcaption></figure></div>

O diagrama acima apresenta a plataforma de IA da Zoom numa forma simplificada, mostrando a plataforma num dos seus estados mais fundamentais. Ele ilustra como diferentes partes da arquitetura mais ampla de produtos e serviços da Zoom, conhecida como backend da Web do Zoom — incluindo áreas como Reuniões, Phone, central de contato, reconhecimento automático de fala e outras ofertas da Zoom — alimentam a plataforma Zoom mais ampla e contribuem para o conjunto de conteúdo acessível ao usuário que pode suportar funcionalidades de IA a jusante.

Um conceito central neste diagrama é **conteúdo do usuário do Zoom**. Isto refere-se ao conteúdo gerado através das interações de um usuário com os produtos e serviços da Zoom, que mais tarde pode servir como entrada, contexto ou artefatos para experiências alimentadas por IA. Dependendo do produto e do recurso envolvidos, isto pode incluir materiais como mensagens do Zoom Chat, resumos da reunião, transcrições, documentos Canvas, My Notes, gravações e outros artefatos semelhantes voltados para o usuário. Estes materiais constituem uma parte importante da camada contextual que pode apoiar futuras tarefas de recuperação, raciocínio, sumarização e acompanhamento assistidas por IA.

Parte deste conteúdo também pode ser preparado para uso futuro por IA através de infraestrutura de recuperação, como recuperação indexada ou módulos de geração aumentada por recuperação. Nesses casos, os artefatos relevantes podem ser ingeridos e indexados para que possam ser localizados e utilizados de forma mais eficiente em consultas ou processos de IA posteriores. Isto ajuda o Zoom AI a trabalhar não apenas com interações em direto, mas também com contexto retido e materiais gerados anteriormente pelo usuário em toda a plataforma.

Por fim, o diagrama também apresenta **Zoom AI** a si mesmo como a camada de IA partilhada que opera em todo este ecossistema mais amplo. Nesta visão simplificada, o Zoom AI é mostrado através da abordagem federada padrão da Zoom, na qual a Zoom pode usar tanto modelos hospedados pela Zoom a funcionar dentro da sua própria infraestrutura como fornecedores selecionados de modelos de IA de terceiros, quando apropriado para a tarefa em questão. Este modelo federado permite à Zoom encaminhar tarefas de IA para o ambiente de modelo mais adequado disponível, mantendo uma experiência de IA unificada em toda a plataforma.

## Abordagens do modelo de serviço do Zoom AI

<div data-with-frame="true"><figure><img src="/files/71ea16107222d5ceef3156a36f2fa685bce32b0f" alt=""><figcaption><p>Visão geral das abordagens de IA da Zoom, incluindo Federada, ZM+ e Somente Modelos Hospedados pelo Zoom (ZMO)</p></figcaption></figure></div>

O diagrama acima ilustra as três abordagens de IA da Zoom: a Abordagem Federada, Zoom-Hosted Models Plus (ZM+) e Somente Modelos Hospedados pelo Zoom (ZMO). Em conjunto, estas representam as três formas principais pelas quais a Zoom fornece serviços de IA aos clientes, oferecendo cada uma um equilíbrio diferente entre amplitude de recursos, flexibilidade de modelo e controlo de dados.

A Abordagem Federada é a abordagem padrão e mais completa em termos de recursos da Zoom. Ela permite que a Zoom trabalhe com vários fornecedores de IA, incluindo modelos hospedados pela Zoom e parceiros selecionados de modelos de terceiros, para que as tarefas possam ser encaminhadas para o modelo mais adequado ao pedido. O ZM+ oferece um modelo de implementação mais controlado, utilizando instâncias dedicadas de modelo geridas pela Zoom, enquanto o ZMO mantém o processamento de IA apenas dentro de modelos hospedados pela Zoom, oferecendo o percurso de modelo mais restritivo e controlado, mas com um conjunto de recursos mais limitado.

Para efeitos desta página, os diagramas que se seguem ilustram, em geral, a abordagem federada, uma vez que ela reflete a abordagem padrão da Zoom e a visão mais ampla da funcionalidade do Zoom AI. As organizações que utilizam ZM+ ou ZMO podem, muitas vezes, interpretar estes mesmos diagramas removendo mentalmente os fornecedores de modelos de IA de terceiros e concentrando-se nas partes restantes do fluxo geridas pela Zoom.

Consulte a página Modelos de IA da Zoom, Processamento, Armazenamento e Utilização para mais informações.

## Recursos e artefatos de mídia ao vivo

<div data-with-frame="true"><figure><img src="/files/512785222f3d591e850e43ad96810bc4cbfa3884" alt=""><figcaption><p>Visão geral de como a mídia ao vivo é transformada em dados de fala para texto que alimentam recursos do Zoom AI</p></figcaption></figure></div>

O diagrama acima ilustra como interações de mídia ao vivo — como reuniões e chamadas telefónicas — podem produzir recursos e artefatos alimentados por IA a jusante em toda a plataforma Zoom. Em cada caso, o áudio ao vivo entra na Zoom através do ponto de ligação associado a esse produto ou serviço. Para reuniões, isto é geralmente o **Roteador Multimédia (MMR)**. Para a telefonia, o áudio normalmente entra por meio de **zonas SIP**.

Depois de o áudio ser captado, ele é encaminhado para o **Reconhecimento Automático de Fala (ASR)** serviço, que converte o áudio ao vivo em **dados de fala para texto**. Esses dados de fala para texto podem ser usados de várias maneiras, dependendo das Configurações e dos recursos ativados. Em alguns casos, são entregues imediatamente aos usuários como **legendas ao vivo**. Em contextos suportados, também podem ser enviados para o serviço de **Tradução ao vivo** da Zoom, que traduz a saída de fala para texto em legendas traduzidas para participantes noutros idiomas.

Os dados de fala para texto também podem suportar recursos mais persistentes ou derivados. Se **a transcrição** estiver ativada, ou se um usuário estiver usando **My Notes**, o serviço ASR pode produzir uma transcrição após o término da sessão ao vivo. No entanto, se a retenção de transcrição não estiver ativada, os dados de fala para texto usados durante a interação não são retidos como uma transcrição persistente. Mesmo nesses casos, o Zoom AI ainda pode usar os dados de fala para texto de forma efémera durante a sessão para suportar recursos de IA em direto.

Por exemplo, um usuário pode fazer **perguntas na reunião** através do Zoom AI durante uma reunião. Nesse caso, o Zoom AI pode usar os dados de fala para texto em direto da reunião para interpretar a pergunta do usuário e gerar uma resposta relevante, fundamentada na conversa em curso.

Uma distinção importante neste fluxo é que o Zoom AI não retém necessariamente uma transcrição da conversa apenas porque os dados de fala para texto foram usados durante a sessão. A menos que a retenção da transcrição esteja especificamente ativada, ou que os dados estejam a ser retidos através de um recurso como **My Notes**a própria transcrição, os dados de fala para texto podem permanecer efémeros. Ao mesmo tempo, alguns artefatos a jusante produzidos a partir desses dados podem persistir. Por exemplo, se um usuário fizer perguntas durante uma reunião, a conversa de IA resultante ou as notas relacionadas podem mais tarde permanecer disponíveis como um artefato retido, mesmo quando não é produzida uma transcrição persistente.

Alguns artefatos retidos também podem tornar-se a base para artefatos e fluxos de trabalho adicionais a jusante. Um resumo da reunião, um resumo de webinar, um resumo de ligar, ou o My Notes de um usuário podem ser convertidos num **documento Canvas do Zoom** onde pode continuar a ser editado, expandido e utilizado como um artefato de trabalho. Por sua vez, esses documentos resultantes podem mais tarde servir como contexto para outros recursos ou fluxos de trabalho de IA discutidos noutro ponto deste documento. Desta forma, o áudio ao vivo pode conduzir não apenas a recursos de IA imediatos, mas também a uma cadeia de artefatos retidos que continuam a suportar trabalhos assistidos por IA mais tarde em toda a plataforma Zoom.

Este diagrama é aplicável aos seguintes recursos:

|            Recursos           |                                               Descrição                                               |     Produto(s)     | Retenção de artefatos |
| :---------------------------: | :---------------------------------------------------------------------------------------------------: | :----------------: | :-------------------: |
|        Legendas ao vivo       |                    Legendas de fala para texto em tempo real para sessões ao vivo.                    | Reuniões, webinars |       Não retido      |
|      legendas traduzidas      |        Legendas traduzidas em tempo real geradas a partir de dados de fala para texto ao vivo.        | Reuniões, webinars |       Não retido      |
|          transcrições         |                  Registos de texto retidos do conteúdo de fala para texto da reunião.                 | Reuniões, Telefone |         Retido        |
|       resumo da reunião       |     Resumo gerado por IA dos principais pontos de discussão da reunião, decisões e itens de ação.     |      Reuniões      |         Retido        |
|       resumo do webinar       |            Resumo gerado por IA do conteúdo principal do webinar partilhado após a sessão.            |      webinars      |         Retido        |
|       Resumo da chamada       |              Resumo gerado por IA após a chamada dos principais detalhes e itens de ação.             |      Telefone      |         Retido        |
|            My Notes           | Notas pessoais, transcrição e contexto da reunião retidos para referência posterior e acompanhamento. |      Reuniões      |         Retido        |
|   Tarefas de acompanhamento   |              Ações de acompanhamento sugeridas por IA com base nos detalhes da conversa.              |     Zoom Tasks     |         Retido        |
| Priorização do correio de voz |         Classificação baseada em IA de correios de voz por importância definida pelo usuário.         |      Telefone      |         Retido        |
|      Perguntas da reunião     |          Respostas da IA às perguntas da reunião usando o contexto da reunião em tempo real.          |      Reuniões      |         Retido        |
|      Perguntas do webinar     |          Respostas da IA às perguntas do webinar usando o contexto do webinar em tempo real.          |      webinars      |         Retido        |
|      Perguntas da chamada     |          Respostas da IA às perguntas da chamada usando o contexto da chamada em tempo real.          |      Telefone      |         Retido        |

## Recursos de gravação

<div data-with-frame="true"><figure><img src="/files/d0961e9c0f3ac63d5b163af12817402aa21b20ff" alt=""><figcaption><p>Visão geral de como o Zoom processa gravações e recursos de IA</p></figcaption></figure></div>

O diagrama acima ilustra como o Zoom AI suporta **recursos de IA baseados em gravação** ao operar na gravação concluída após o término da sessão ao vivo. Tal como noutras experiências do Zoom baseadas em áudio, a mídia original entra pela infraestrutura associada ao produto em uso — como o **MMR** para reuniões ou a relevante **zona SIP** para telefonia. Como parte desse fluxo, a gravação é criada e enviada para o serviço de gravação do Zoom, onde a gravação concluída é então armazenada no armazenamento de conteúdo do Zoom.

Uma vez finalizada a gravação, o áudio associado a essa gravação é enviado para o serviço de transcrição do Zoom. **Reconhecimento Automático de Fala (ASR)** Este processo produz uma **transcrição específica da gravação**, que pode diferir dos dados de fala para texto gerados durante a própria sessão ao vivo. Por outras palavras, a transcrição associada a uma gravação concluída é gerada como parte do fluxo de processamento pós-gravação, em vez de ser simplesmente copiada da camada de interação ao vivo.

Depois de a transcrição da gravação ser produzida, ela pode então ser enviada para **Zoom AI** Zoom AI

para análise adicional. Nesta fase, o Zoom AI processa a transcrição para identificar artefactos de gravação de nível superior, como resumos, destaques, capítulos e outras representações estruturadas da conversa. Esta análise é realizada usando a camada de processamento de IA do Zoom, incluindo modelos alojados no Zoom, quando aplicável, para transformar a transcrição bruta da gravação em resultados mais úteis pós-reunião ou pós-chamada. Uma vez concluída essa análise, os artefactos gerados por IA resultantes ficam associados à própria gravação. É isso que permite aos usuários que visualizam uma gravação ver não apenas a gravação e a transcrição, mas também as camadas adicionais geradas por IA que tornam o conteúdo mais fácil de navegar e compreender. Dessa forma, o diagrama mostra como uma gravação concluída pode tornar-se a base para uma segunda etapa de processamento por IA, produzindo recursos de gravação enriquecidos que vão além da mídia armazenada original.

Este diagrama é aplicável aos seguintes recursos:

|                      Recursos                      |                                                                        Descrição                                                                       |  Produto(s) | Retenção de artefatos |
| :------------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------------: | :---------: | :-------------------: |
|                gravação inteligente                |                                          Destaques, capítulos e resumos gerados por IA para reuniões gravadas                                          |   Reuniões  |         Retido        |
|        Gerar títulos, descrições e etiquetas       |                                               Títulos, descrições e etiquetas gerados por IA para clipes.                                              |    Clipes   |         Retido        |
| Criação de conteúdo por IA para gravações e vídeos | Usa transcrições de gravações do Evento para gerar conteúdo escrito e trechos de vídeo selecionados por IA a partir dos principais momentos da sessão. | Zoom Events |         Retido        |

## Funcionalidades de IA derivadas

<div data-with-frame="true"><figure><img src="/files/10260be55cf100b012c9fd2f64db32f628305fa4" alt=""><figcaption><p>Visão geral de como o Zoom processa funcionalidades de geração de conteúdo de IA derivada</p></figcaption></figure></div>

O diagrama acima ilustra como **funcionalidades de IA derivadas** operar usando conteúdo Disponível do usuário como contexto para tarefas e resultados assistidos por IA posteriores. Nesses casos, o Zoom AI não está mais trabalhando apenas a partir de dados de interação ao vivo. Em vez disso, ele está se apoiando em artefatos que já existem no ambiente de conteúdo mais amplo do usuário, a fim de responder a uma pergunta, sintetizar informações ou ajudar a produzir um novo resultado.

Dependendo da tarefa, este material contextual pode incluir artefatos como mensagens de chat, resumos de reunião, My Notes, transcrições, documentos do Zoom Canvas, apresentações do Zoom Slide decks, documentos do Zoom Paper, conteúdo do Zoom Mail ou do Zoom Calendar, dados de e-mail ou de calendário de terceiros conectados ou arquivos enviados pelo usuário para dar suporte a uma solicitação específica. Dessa forma, o Zoom AI está usando artefatos do Zoom criados anteriormente, juntamente com dados pessoais integrados quando disponíveis, para ajudar a atingir o objetivo final solicitado pelo usuário.

O diagrama também reflete que este processo pode, por si só, gerar **novo conteúdo do usuário**. Por exemplo, o Zoom AI pode usar materiais existentes para criar uma nova Zoom Sheet, um documento Zoom Canvas, um deck de Zoom Slide ou um documento Zoom Paper. Depois de criados, esses novos artefatos passam a fazer parte do repositório de conteúdo mais amplo do usuário e podem mais tarde ser usados novamente como contexto para futuras funções e fluxos de trabalho assistidos por IA. Isso cria uma progressão em camadas na qual o conteúdo anterior do usuário pode dar suporte a resultados posteriores, e esses resultados, por sua vez, podem tornar-se novos artefatos contextuais ao longo do tempo.

Esse mesmo padrão também pode aparecer em outras superfícies do Zoom. Em ambientes como **Zoom Hub** ou o **painel de chat de IA**, os usuários podem fazer perguntas na plataforma ou interagir com documentos e materiais disponíveis por meio da suíte de produtividade de IA do Zoom. Nesses casos, o Zoom AI está novamente trabalhando a partir de artefatos existentes acessíveis ao usuário para fornecer recuperação, síntese, respostas a perguntas ou acompanhamento, mostrando como os recursos derivados de IA estendem o valor do conteúdo anterior para novas tarefas e resultados.

{% hint style="info" %}
**Nota**

Carregamentos locais de arquivos do usuário [podem ser desativados](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

Este diagrama é aplicável aos seguintes recursos:

|       Recursos       |                                                                                 Descrição                                                                                |           Produto(s)          | Retenção de artefatos |
| :------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------------------------: | :-------------------: |
|  Geração de conteúdo | A geração de conteúdo usa IA para criar, refinar, resumir e organizar documentos, apresentações, planilhas e outros resultados a partir de prompts em linguagem natural. | Canvas, Sheets, Paper, Slides |         Retido        |
| painel de chat de IA |                         Assistência de IA conversacional para fazer perguntas, gerar conteúdo e trabalhar em todo o contexto Disponível do Zoom.                         |      painel de chat de IA     |         Retido        |
|    Fazer perguntas   |                                          Respostas geradas por IA com base nos documentos e materiais selecionados no Zoom hub.                                          |              hub              |         Retido        |

## Funcionalidades de Geração e Composição

<div data-with-frame="true"><figure><img src="/files/15b58ddc6f9cee389d9a794d49da6537361e0beb" alt=""><figcaption><p>Visão geral de como o Zoom processa solicitações de IA generativa e de composição</p></figcaption></figure></div>

O diagrama acima ilustra como **recursos generativos e de composição** operar dentro da plataforma Zoom AI. Ao contrário dos recursos de IA derivada, que dependem de conteúdo de usuário pré-existente para ajudar a alcançar uma tarefa ou resultado posterior, os recursos generativos e de composição são frequentemente impulsionados de forma mais direta pela entrada imediata do usuário. Em muitos casos, esses recursos não dependem de artefatos retidos do Zoom já armazenados em outro lugar no ambiente de conteúdo do usuário. Em vez disso, eles são alimentados principalmente por prompts diretos do usuário, consultas, arquivos carregados ou pelo conteúdo imediato na tela associado à experiência de produto Ativo.

Esta distinção é especialmente importante para recursos que funcionam a partir de conteúdo visível no contexto atual do usuário, em vez de artefatos previamente indexados ou retidos. Por exemplo, quando um usuário resume um chat, resume um e-mail ou pede ao Zoom AI para redigir uma resposta a um e-mail, o conteúdo relevante normalmente é retirado do contexto do cliente Ativo e empacotado em uma carga útil de solicitação para processamento pelo Zoom AI. Em outras palavras, o Zoom não está necessariamente recuperando esse conteúdo de um repositório separado no lado do servidor para concluir a tarefa. Em vez disso, as informações relevantes do tópico Ativo, do conjunto de mensagens ou de outro contexto de interface visível são convertidas para a forma de texto e enviadas ao Zoom AI pelo aplicativo Zoom Workplace para que o serviço possa realizar processamento de linguagem natural, sumarização ou geração.

O diagrama também inclui casos de uso generativos que dependem principalmente de instruções diretas do usuário, em vez de material de origem textual. Por exemplo, quando um usuário solicita a geração de imagens, o usuário descreve a saída desejada por meio de um prompt, e o modelo gera a imagem com base nessa descrição. Em alguns contextos de produto, como o Zoom Whiteboard, essa geração de imagens pode depender de provedores de modelos de IA de terceiros. Em outros contextos, o Zoom pode usar seus próprios modelos hospedados. Por exemplo, a geração de imagem do plano de fundo virtual do Zoom pode depender de um modelo hospedado pelo Zoom que usa embeddings e processamento relacionado para gerar saídas visuais, com o conteúdo resultante passando por controles de moderação antes de ser devolvido ao usuário.

Em conjunto, o diagrama mostra que os recursos generativos e de composição muitas vezes dependem menos de artefatos retidos e mais da intenção imediata do usuário, do contexto Ativo no lado do cliente ou de materiais de apoio carregados. Dessa forma, eles representam outro grande modo de operação do Zoom AI: não apenas recuperar e raciocinar sobre conteúdo anterior, mas também gerar novas saídas diretamente a partir da solicitação atual do usuário e do contexto circundante.

Este diagrama é aplicável aos seguintes recursos:

|                Recursos               |                                                                                           Descrição                                                                                           |         Produto(s)         | Retenção de artefatos |
| :-----------------------------------: | :-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :------------------------: | :-------------------: |
|         plano de fundo virtual        |                                  Usa IA para criar imagens personalizadas de plano de fundo virtual a partir de prompts do usuário para uso em Zoom Sessions.                                 | Reuniões, Eventos, webinar |   Retido (se salvo)   |
|           Geração de imagens          |                  Usa IA para transformar desenhos de quadro de compartilhamento ou artefatos visuais brutos em resultados visuais mais polidos, renderizados ou estilizados.                  | quadro de compartilhamento |   Retido (se salvo)   |
|           Geração de imagens          |                      Usa IA para criar imagens com marca e outros ativos visuais para eventos, como cabeçalhos, imagens de sessão e materiais relacionados a exposições.                      |           Eventos          |   Retido (se salvo)   |
|          Geração de conteúdo          | Usa IA para gerar conteúdo no quadro de compartilhamento na tela, como texto, notas adesivas, tabelas, mapas mentais e outros elementos visuais estruturados, a partir de prompts do usuário. | quadro de compartilhamento |   Retido (se salvo)   |
|          Geração de conteúdo          |                              Usa IA para gerar conteúdo escrito do Evento, como descrições, detalhes da sessão, biografias dos palestrantes e anúncios do saguão.                             |           Eventos          |   Retido (se salvo)   |
|           redação de e-mail           |                                        Usa IA para redigir e refinar conteúdo de e-mail, incluindo o corpo da mensagem, linhas de assunto e respostas.                                        |           e-mail           |  Retido (se enviado)  |
|            Redação de chat            |                                     Usa IA para redigir e revisar mensagens de chat com base nos prompts do usuário e no contexto de conversa Disponível.                                     |            chat            |  Retido (se enviado)  |
|            Resumo do e-mail           |                                                     Usa IA para resumir o conteúdo principal de um e-mail ou de uma sequência de e-mails.                                                     |           e-mail           |       Não retido      |
| Mensagem, Thread, Resumo de documento |                                   Usa IA para resumir mensagens de chat, threads de conversa e documentos anexados suportados ou conteúdo Canvas vinculado.                                   |            chat            |       Não retido      |
|           Upload inteligente          |                                   Extrai detalhes do Evento de ficheiros carregados para criar automaticamente sessões, oradores e perguntas personalizadas.                                  |         Zoom Events        |   Retido (se salvo)   |

## My Notes

### As minhas notas em Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/495151d6bb951989495386116992e14615477f3e" alt=""><figcaption><p>Visão geral dos fluxos de dados das minhas notas em Zoom Meetings</p></figcaption></figure></div>

O diagrama acima mostra como, dentro do Zoom Meetings, o My Notes usa o caminho de áudio existente da reunião em vez de depender de outro áudio presente no Dispositivo do usuário. Quando o My Notes é ativado durante uma reunião no Zoom, ele acede ao áudio da reunião partilhado encaminhado pela sessão Multi-Media Router (MMR) da reunião. Esse áudio é então processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao Dispositivo do usuário e pode depois apoiar a geração de notas após a reunião.

Neste fluxo, a transcrição baseia-se especificamente no áudio do Zoom Meetings associado a essa sessão de reunião. Não se baseia no áudio local do Dispositivo não relacionado fora da própria reunião. Depois de a reunião terminar, a transcrição e as notas resultantes podem permanecer disponíveis de acordo com as Configurações de retenção aplicáveis do usuário, enquanto o áudio subjacente usado para a transcrição não é retido após a conclusão do processamento.

### As minhas notas fora de Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/d916dbe3e22bacf2c90b4dfd6495c4b23b82cdba" alt=""><figcaption><p>Visão geral dos fluxos de dados do My Notes fora das reuniões do Zoom</p></figcaption></figure></div>

O diagrama acima mostra como, fora do Zoom Meetings, o My Notes opera por meio do áudio do dispositivo local do usuário, em vez de por meio de uma sessão compartilhada de reunião do Zoom. Se ativado durante uma reunião de terceiros ou uma discussão presencial, o My Notes pode usar o acesso em nível do sistema operacional ao microfone do usuário e, quando aplicável, ao áudio do sistema para capturar o áudio local disponível nesse dispositivo. Esse áudio é então roteado por meio de uma sessão MMR de usuário único e processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao dispositivo do usuário e pode posteriormente dar suporte à geração de notas pós-reunião.

Isso significa que, fora do Zoom Meetings, a transcrição se baseia exclusivamente no áudio transmitido do dispositivo local do usuário, e não em um fluxo de áudio compartilhado da reunião do Zoom. O My Notes também pode solicitar ao usuário que inicie uma nova nota quando a atividade do microfone do dispositivo for detectada, ajudando a destacar o recurso em situações como reuniões de terceiros, gravações baseadas no navegador ou outros fluxos de trabalho com microfone ativo. Assim como no fluxo em reunião, o áudio usado para transcrição não é retido após a conclusão da transcrição, enquanto as notas e transcrições resultantes podem permanecer salvas na conta do usuário de acordo com as Configurações de retenção aplicáveis.

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/95d959a5950a2e5d70b73d6fd288be71625fef2b" alt=""><figcaption><p>Visão geral dos fluxos de dados do ZoomMate</p></figcaption></figure></div>

O diagrama acima ilustra como **O ZoomMate funciona como uma superfície de trabalho principal dentro do Zoom Workplace**, operando no ponto em que o contexto do usuário, o conhecimento conectado e as capacidades de execução se encontram. Em vez de existir apenas como um assistente autônomo, o ZoomMate fica no centro de um ambiente de trabalho mais amplo em que os usuários podem pesquisar, raciocinar, criar e agir sobre os materiais e sistemas que dão suporte ao trabalho do dia a dia.

Uma parte importante dessa função vem do acesso do ZoomMate a **conteúdo próprio do Zoom**. Isso pode incluir artefatos como resumos, My Notes, gravações, documentos Canvas, mensagens de chat e outros materiais gerados pelo usuário criados na plataforma Zoom. Esses artefatos ajudam a fornecer ao ZoomMate o contexto de que ele precisa para responder a perguntas, sintetizar informações, gerar resultados e apoiar o acompanhamento. O ZoomMate também pode usar **memória**, permitindo que incorpore preferências relevantes do usuário ou detalhes relacionados ao trabalho ao ajudar a concluir uma tarefa.

O diagrama também mostra como o ZoomMate se estende além do conteúdo nativo do Zoom, integrando-se com **fontes de conhecimento de terceiros**. Por exemplo, serviços conectados de Armazenamento em nuvem, como Google Drive ou OneDrive, podem servir como repositórios externos de informações acessíveis ao usuário. Quando essas fontes são integradas, o Zoom pode indexar conteúdo aprovado para dar suporte à recuperação nesses materiais, permitindo que o ZoomMate use **busca agêntica** para funcionar tanto sobre o conteúdo do Zoom quanto sobre o conhecimento de terceiros conectado. Dessa forma, o ZoomMate pode pesquisar não apenas no que existe no Zoom, mas também nos documentos e materiais que um usuário está autorizado a acessar em plataformas externas conectadas.

Outras fontes de dados pessoais, como **e-mail e calendário** (excluindo e-mails criptografados de ponta a ponta), também podem dar suporte ao ZoomMate, mas elas operam de forma diferente. Em vez de serem indexadas, essas fontes geralmente se comunicam com o ZoomMate por meio de recuperação direta baseada em API. Isso as torna úteis para tarefas como localizar contexto relevante de e-mail, revisar informações do calendário ou ajudar a Agendar eventos, sem tratá-las como parte da camada de recuperação indexada usada para uma busca mais ampla de documentos.

O diagrama também reflete que o ZoomMate pode se conectar com uma gama mais ampla de **serviços e conectores de terceiros** que dão Suporte à tomada de ação, bem como ao Acessar conhecimento. Isso pode incluir sistemas como Jira, HubSpot, ServiceNow, Workday e outras plataformas corporativas conectadas. Por meio dessas conexões, o ZoomMate pode executar **tarefas agênticas** em nome do usuário, como criar ou atualizar registros, recuperar informações de serviços externos ou realizar outras ações conectadas dentro desses sistemas. Isso faz do ZoomMate mais do que uma superfície de recuperação e síntese; ele também funciona como uma camada de execução que pode ajudar a transformar contexto em ação.

Essa mesma base também ajuda a impulsionar **agentes** e **fluxos de trabalho** no ambiente do ZoomMate. Os agentes podem usar o mesmo contexto subjacente, os mesmos caminhos de recuperação e os mesmos sistemas conectados para realizar uma assistência mais dinâmica, baseada em raciocínio, ajudando os usuários a executar tarefas mais amplas, de várias etapas, com maior continuidade e adaptabilidade. Os fluxos de trabalho, por outro lado, podem fornecer automação mais estruturada e repetível, permitindo que os usuários definam processos recorrentes que operam sobre o conteúdo do Zoom e, quando houver suporte, em sistemas externos conectados. Dessa forma, o ZoomMate serve não apenas como uma interface conversacional, mas também como um ponto de orquestração tanto para atividades agênticas dinâmicas quanto para uma automação mais estruturada.

**Sandbox** também pode dar Suporte a algumas das capacidades de execução mais avançadas do ZoomMate. Para tarefas que exigem execução de código, geração de arquivos, automação ou outro processamento mais sofisticado, o ZoomMate pode usar um ambiente sandbox separado, em vez de depender apenas do processamento conversacional padrão. Esse sandbox é executado na infraestrutura AWS do Zoom e fornece uma camada de execução isolada e de curta duração para tarefas de maior complexidade, ajudando o ZoomMate a realizar determinadas operações em um ambiente mais controlado. Dessa forma, a mesma base mais ampla do ZoomMate que dá Suporte à recuperação, ao raciocínio, aos agentes e aos fluxos de trabalho também pode dar Suporte à execução de tarefas mais avançadas quando o trabalho solicitado assim exigir.

Por fim, o diagrama não descreve todos os componentes subjacentes que ajudam a impulsionar o ZoomMate. Ele não Mostrar explicitamente camadas de capacidade fundamentais, como habilidades, nem outras estruturas de Suporte que fazem parte da infraestrutura e do design mais amplos do Zoom AI. Esses elementos presumem-se operar dentro do sistema de IA subjacente que possibilita o comportamento do ZoomMate. O objetivo deste diagrama é, em vez disso, Mostrar as principais superfícies de contexto, conhecimento e ação por meio das quais o ZoomMate funciona como uma superfície de trabalho unificada no Zoom e em sistemas conectados.

### Conexões e indexação de terceiros do ZoomMate

<figure><img src="/files/d1d06f76f22b359bf0276c332b6a0179e778a7e4" alt="" width="375"><figcaption><p>Visão geral de como o ZoomMate se conecta a conexões de terceiros e fontes de dados</p></figcaption></figure>

O diagrama acima ilustra duas partes relacionadas, mas distintas, da arquitetura de dados de terceiros do ZoomMate. A primeira é como o ZoomMate se conecta a aplicativos e serviços de terceiros suportados para que possa recuperar informações ou executar ações nesses sistemas. A segunda é como determinadas fontes de conteúdo de terceiros suportadas podem ser ingeridas e indexadas para que o ZoomMate possa, posteriormente, recuperar esse conteúdo de forma mais eficiente por meio de geração aumentada por recuperação.

#### <mark style="color:azul;">O ZoomMate pode conectar-se diretamente a aplicativos e serviços de terceiros</mark>

Uma parte do diagrama mostra como o ZoomMate se conecta a aplicativos de terceiros suportados, como Jira, Confluence, Salesforce, ServiceNow, Workday, plataformas de Armazenamento em nuvem e outros sistemas corporativos externos. Essas conexões permitem que o ZoomMate opere além do conteúdo nativo do Zoom, interagindo com ferramentas que armazenam dados corporativos ou dão suporte ao trabalho operacional fora da plataforma Zoom.

Essas conexões são estabelecidas por meio de uma conexão TLS através de modelos de acesso autorizados, como integrações baseadas em API ou conexões baseadas em MCP. Em qualquer dos casos, o ZoomMate opera dentro das permissões concedidas pelo serviço conectado. Isso permite que o ZoomMate recupere informações relevantes desses sistemas e, quando suportado, execute ações neles em nome do usuário. Por exemplo, o ZoomMate pode recuperar detalhes de um problema do Jira, pesquisar uma página do Confluence, atualizar um registo no ServiceNow ou usar outro sistema conectado como parte da execução de uma tarefa mais ampla.

Este modelo de conexão direta é especialmente importante para tarefas que dependem do estado atual do sistema ou do acesso em tempo real a ferramentas de terceiros. Nesses casos, o ZoomMate pode usar o aplicativo conectado como um ponto de extremidade de serviço ativo, em vez de apenas como um repositório de conteúdo previamente indexado.

#### <mark style="color:azul;">O ZoomMate pode indexar conteúdo de terceiros aprovado para recuperação posterior</mark>

Uma segunda parte do diagrama mostra como o ZoomMate pode ingerir e indexar conteúdo de fontes de terceiros suportadas para que o material possa ser recuperado posteriormente como parte de uma pesquisa ou de uma resposta assistida por IA. Este modelo de recuperação indexada é mais relevante para repositórios de conteúdo conectados, como sistemas de Armazenamento em nuvem, bases de conhecimento, plataformas de documentos e outras fontes suportadas nas quais o ZoomMate pode precisar pesquisar num volume maior de conteúdo externo retido.

Depois de uma fonte suportada estar conectada e aprovada para indexação, o ZoomMate pode recuperar conteúdo dessa fonte e prepará-lo para pesquisa posterior. Esse processo de preparação pode incluir dividir ficheiros ou registos maiores em unidades menores e adicionar metadados, como informações de origem, hora da atualização, propriedade e Permissão. Esse conteúdo é então gravado na camada de indexação do Zoom para que possa mais tarde ser pesquisado por meio de correspondência exata e recuperação baseada em significado.

Quando um usuário envia uma solicitação que depende de conteúdo indexado de terceiros, o ZoomMate pode pesquisar esse material indexado, avaliar quais resultados são mais relevantes e aplicar as informações de Permissão associadas à fonte original para que apenas o conteúdo autorizado esteja apto a aparecer. O conteúdo autorizado mais relevante pode então ser passado para a camada de IA do ZoomMate como contexto de apoio para a resposta. Dessa forma, o diagrama mostra como o conteúdo indexado de terceiros pode ajudar o ZoomMate a produzir respostas fundamentadas em materiais corporativos conectados reais, em vez de depender apenas do conhecimento geral do modelo.

## Avatares personalizados

### Criação de Avatar

<div data-with-frame="true"><figure><img src="/files/d2c1fa6249ead8991505fabf803a6d59cc3bac42" alt=""><figcaption><p>Visão geral do processo de criação de avatar personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como um avatar personalizado é criado a partir do vídeo e da voz gravados de um usuário. O processo começa quando o usuário é apresentado com um roteiro e solicitado a gravar-se lendo-o. Esta etapa de gravação guiada permite que o Zoom capture o material audiovisual necessário para gerar tanto a aparência do avatar do usuário quanto o modelo de voz associado usado em futuras saídas baseadas em avatar.

Após o usuário concluir a gravação, os componentes de áudio e vídeo são processados por caminhos diferentes. O áudio é enviado para um serviço de terceiros que gera uma semelhança de voz com base na fala gravada do usuário. Quando esse processamento é concluído, o serviço de terceiros retorna ao Zoom um identificador de voz exclusivo. O Zoom armazena esse identificador como a referência de voz do usuário para que possa ser usado posteriormente ao gerar clipes baseados em avatar ou outras saídas suportadas que dependem dessa voz sintetizada.

Ao mesmo tempo, o componente de vídeo é enviado para um módulo de geração de avatar hospedado no Zoom, onde o Zoom processa o material visual gravado para criar a representação de avatar do usuário. Isso resulta em um modelo de avatar que o Zoom armazena para uso futuro. Em conjunto, essas duas saídas retidas — o identificador de voz armazenado e o modelo de avatar armazenado — permitem que o Zoom gere futuros clipes ou mídia baseada em avatar que reflitam tanto a aparência do usuário quanto sua voz sintetizada.

### Criação de clipe

<div data-with-frame="true"><figure><img src="/files/8fe54ff5f0adefb5d4262aad650422ee2ade1b6b" alt=""><figcaption><p>Visão geral do processo de criação de clipe do Avatar Personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como um clipe de avatar personalizado é criado a partir do avatar armazenado e do perfil de voz sintetizada de um usuário. O processo começa quando o usuário envia o roteiro que deseja que o avatar apresente. Esse roteiro serve como o conteúdo de origem para o clipe gerado.\
\
A partir daí, o backend web do Zoom coordena duas entradas paralelas necessárias para criar a saída final. Primeiro, ele envia o identificador de voz armazenado do usuário, juntamente com o roteiro, para o serviço de geração de voz de terceiros, que produz o áudio do clipe usando a voz sintetizada do usuário. Segundo, ele envia o modelo de avatar armazenado do usuário para o módulo de geração de avatar do Zoom, para que o componente visual do clipe possa ser preparado usando a aparência de avatar previamente criada do usuário.\
\
Depois que o serviço de geração de voz de terceiros produz o áudio, esse áudio é retornado ao Zoom e passado para o módulo de geração de avatar. O módulo de geração de avatar então combina o modelo de avatar armazenado com o áudio de voz gerado, sincronizando os movimentos faciais e labiais do avatar com o conteúdo falado. Depois que esse processo de sincronização labial e renderização é concluído, o Zoom produz o clipe de avatar finalizado e o entrega de volta ao usuário.

## Dicionário personalizado

<div data-with-frame="true"><figure><img src="/files/375097cdc14f3a510953914c8a9e7a995a5816da" alt=""><figcaption><p>Fluxos de dados do dicionário personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como os Recursos de Dicionário Personalizado ajudam a melhorar a precisão dos resultados do Zoom baseados em fala, fornecendo ao serviço de Reconhecimento Automático de Fala (ASR) do Zoom um contexto vocabular adicional. Esses Recursos foram projetados para dar suporte a palavras, abreviações, jargão, nomes de produtos ou terminologia especializada que podem ser específicos de uma empresa, setor, equipe ou região e que talvez não sejam reconhecidos ou representados corretamente durante a transcrição.

O processo começa quando um administrador da conta cria e armazena um dicionário personalizado no Portal web do Zoom. Esse dicionário contém a lista de palavras ou frases aprovadas que a Organização quer que o Zoom reconheça com mais precisão. Depois que o dicionário é salvo no nível da conta, ele fica Disponível para uso em contextos compatíveis de reunião e processamento de fala.

Quando um usuário inicia uma reunião posteriormente, o serviço AASR do Zoom pode receber o dicionário personalizado da conta como parte do seu contexto de processamento. À medida que o serviço de ASR converte áudio ao vivo em dados de fala para texto, ele pode comparar a linguagem falada percebida com o dicionário personalizado e tentar mapear os sons reconhecidos para os termos armazenados. Isso fornece ao ASR orientação adicional sobre quais palavras procurar, como certos termos podem ser escritos e como abreviações ou linguagem especializada devem ser interpretadas.

O resultado é que a saída inicial de fala para texto pode refletir com mais precisão a terminologia realmente usada na reunião. Essa precisão aprimorada pode então ser levada adiante para os artefatos posteriores derivados da conversa. Por exemplo, se um resumo da reunião, legendas, transcrição ou outro ativo baseado em dados de fala para texto for gerado posteriormente, esses resultados podem refletir uma representação mais precisa das palavras ditas durante a reunião, ajudando a melhorar a qualidade e a utilidade do artefato gerado por IA resultante.

## Modelos personalizados de resumo da reunião

<div data-with-frame="true"><figure><img src="/files/1686ebc8927ffc8c618714f542c97654441d58c7" alt=""><figcaption><p>Fluxos de dados de modelos personalizados de resumo da reunião</p></figcaption></figure></div>

O diagrama acima ilustra como resumos personalizados da reunião são gerados a partir de um modelo definido pelo usuário ou pela conta. O processo começa quando um modelo é criado e salvo no Zoom. No nível da conta, um administrador pode definir um modelo personalizado de resumo da reunião para uso organizacional. No nível individual, um usuário pode criar um modelo pessoal de resumo da reunião com base em suas próprias preferências. Depois de criado, o modelo selecionado é armazenado para que possa ser aplicado em gerações posteriores do resumo.

À medida que uma reunião termina, o Zoom AI pode usar os dados de fala para texto da reunião para gerar um resumo que siga a estrutura e a ênfase do modelo personalizado escolhido. Se o modelo personalizado foi selecionado antes de o resumo da reunião ser gerado, o Zoom AI aplica esse modelo diretamente ao produzir o resumo. Isso permite que o resultado final reflita o formato, as seções ou as prioridades específicas definidas no modelo, em vez de apenas uma estrutura de resumo padrão.

Se um modelo personalizado não foi selecionado antes de o resumo ser gerado pela primeira vez, o Zoom só pode aplicar esse modelo mais tarde se a transcrição da reunião tiver sido retida. Nesse caso, o Zoom AI pode reprocessar a transcrição retida usando a configuração do modelo e produzir um novo resumo alinhado com essa estrutura. Se a transcrição não tiver sido retida, no entanto, o Zoom não tem a transcrição subjacente Disponível para reprocessamento, o que significa que o modelo personalizado não pode ser aplicado depois do fato.

## Isolamento de áudio pessoal

<div data-with-frame="true"><figure><img src="/files/35efad202c50c597681aa60325c4b2bb48e3ebf5" alt=""><figcaption><p>Visão geral de como o Isolamento de áudio pessoal isola a voz de um usuário</p></figcaption></figure></div>

O diagrama acima ilustra como **Isolamento de áudio pessoal** funciona usando uma impressão de voz armazenada localmente no Dispositivo do usuário para distinguir a fala do usuário do Ruído de fundo circundante. O processo começa quando o usuário grava uma amostra de voz por meio do Recursos de Personal Audio Isolation no aplicativo Zoom Workplace. Essa gravação é usada para criar uma impressão de voz local que ajuda o aplicativo a reconhecer as características da voz do usuário. Essa impressão de voz permanece na máquina local e não é transmitida para a nuvem Zoom cloud.

Quando o usuário fala mais tarde durante uma reunião em um ambiente com ruído ambiente, o aplicativo Zoom Workplace usa essa impressão de voz armazenada localmente para ajudar a identificar os padrões de voz do usuário e separá-los dos sons ao redor. Isso permite que o aplicativo reduza o Ruído de fundo (Reduzir ruído de fundo) e isole a voz do usuário de forma mais eficaz antes que o áudio seja encaminhado pelo fluxo da reunião.

Como resultado, o áudio transmitido para a Zoom cloud é o áudio de reunião refinado, com ruído ambiente filtrado na medida em que isso é suportado pelo Recursos. A impressão vocal subjacente do usuário em si não é enviada para a infraestrutura de nuvem da Zoom. Dessa forma, o Personal Audio Isolation funciona como um Recursos de processamento local no nível do Dispositivo que melhora a clareza do áudio antes de o áudio limpo ser transmitido para a live reunião Zoom sessão.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/pt/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
