> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/pt/ai/ai-whitepaper/diagrams.md).

# Diagramas e fluxos de dados

As capacidades de IA do Zoom abrangem uma ampla gama de produtos, serviços e fluxos de trabalho, o que significa que nenhum diagrama isolado consegue capturar de forma razoável ou completa como a IA funciona em toda a plataforma Zoom. Diferentes recursos dependem de diferentes entradas, caminhos de processamento, comportamentos de armazenamento, interações entre modelos e saídas. Alguns operam apenas em dados ao vivo e efêmeros durante uma interação ativa, enquanto outros criam artefatos retidos que podem posteriormente dar suporte a recursos adicionais. Algumas funções permanecem totalmente no ambiente de primeira parte do Zoom, enquanto outras dependem da arquitetura de IA federada do Zoom e, em alguns casos, de sistemas externos conectados. Para tornar esse sistema dinâmico e amplo mais fácil de entender, esta página apresenta uma série de diagramas em vez de depender de um único modelo visual. Cada um destaca uma camada, um caminho ou um padrão de recurso diferente dentro da plataforma Zoom AI mais ampla. Na parte inferior destas seções há tabelas que detalham quais recursos são aplicáveis, o produto associado e o status de retenção dos artefatos. As seções posteriores então examinam certos recursos de produto específicos individualmente, oferecendo explicações mais focadas sobre como essas capacidades específicas funcionam.

A sequência começa abaixo com uma visão geral simplificada do Zoom AI em sua forma mais básica, mostrando a plataforma em um estado centrado na própria Zoom que usa a arquitetura padrão de modelo federado do Zoom, mas ainda não introduz integrações empresariais de terceiros ou fontes externas de dados de clientes além dos provedores de modelos de IA de terceiros do Zoom. A partir daí, os diagramas introduzem gradualmente partes mais especializadas da plataforma, incluindo as opções de abordagem de IA do Zoom, a transformação de áudio ao vivo em artefatos utilizáveis pela IA e as formas pelas quais esses artefatos podem posteriormente dar suporte a outros recursos e fluxos de trabalho. Em conjunto, estes diagramas têm como objetivo tornar um sistema altamente complexo mais acessível, dividindo-o em visualizações menores e mais fáceis de acompanhar que refletem como diferentes partes da plataforma de IA do Zoom funcionam na prática.

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/990e29ac5917c319f2503017bee61d0705641c30" alt=""><figcaption><p>Uma visão geral simples do Zoom AI</p></figcaption></figure></div>

O diagrama acima apresenta a plataforma de IA do Zoom em uma forma simplificada, mostrando a plataforma em um de seus estados mais fundamentais. Ele ilustra como diferentes partes da arquitetura mais ampla de produtos e serviços do Zoom, conhecida como back-end Web do Zoom — incluindo áreas como Reuniões, Phone, central de contato, reconhecimento automático de fala e outras ofertas do Zoom — alimentam a plataforma maior do Zoom e contribuem para o conjunto de conteúdo acessível ao usuário que pode dar suporte à funcionalidade de IA subsequente.

Um conceito central neste diagrama é **conteúdo do usuário do Zoom**. Isto se refere ao conteúdo gerado por meio das interações de um usuário com os produtos e serviços do Zoom, que pode posteriormente servir como entrada, contexto ou artefatos para experiências com IA. Dependendo do produto e do recurso envolvidos, isso pode incluir materiais como mensagens do Zoom Chat, resumos da reunião, transcrições, documentos do Canvas, Minhas Notas, gravações e outros artefatos semelhantes voltados ao usuário. Esses materiais formam uma parte importante da camada contextual que pode dar suporte posterior à recuperação assistida por IA, ao raciocínio, à sumarização e ao acompanhamento.

Parte desse conteúdo também pode ser preparada para uso futuro pela IA por meio de infraestrutura de recuperação, como recuperação indexada ou módulos de geração aumentada por recuperação. Nesses casos, os artefatos relevantes podem ser ingeridos e indexados para que possam ser localizados e usados com mais eficiência em consultas ou processos de IA posteriores. Isso ajuda o Zoom AI a მუშაობar não apenas com interações ao vivo, mas também com contexto retido e materiais gerados anteriormente pelo usuário em toda a plataforma.

Por fim, o diagrama também apresenta **Zoom AI** a si mesmo como a camada de IA compartilhada que opera em todo esse ecossistema mais amplo. Nesta visão simplificada, o Zoom AI é mostrado por meio da abordagem federada padrão do Zoom, na qual o Zoom pode usar tanto modelos hospedados pelo Zoom em execução na própria infraestrutura do Zoom quanto provedores selecionados de modelos de IA de terceiros, quando apropriado para a tarefa em questão. Esse modelo federado permite que o Zoom direcione tarefas de IA para o ambiente de modelo disponível mais adequado, mantendo uma experiência de IA unificada em toda a plataforma.

## Abordagens do modelo de serviço do Zoom AI

<div data-with-frame="true"><figure><img src="/files/71ea16107222d5ceef3156a36f2fa685bce32b0f" alt=""><figcaption><p>Visão geral das abordagens de IA do Zoom, incluindo a Abordagem Federada, ZM+ e Somente Modelos Hospedados pelo Zoom (ZMO)</p></figcaption></figure></div>

O diagrama acima ilustra as três abordagens de IA do Zoom: a Abordagem Federada, Modelos Hospedados pelo Zoom Plus (ZM+) e Somente Modelos Hospedados pelo Zoom (ZMO). Em conjunto, elas representam as três principais maneiras pelas quais o Zoom fornece serviços de IA aos clientes, cada uma oferecendo um equilíbrio diferente entre amplitude dos recursos, flexibilidade do modelo e controle dos dados.

A Abordagem Federada é a abordagem padrão do Zoom e a mais completa em termos de recursos. Ela permite que o Zoom trabalhe com vários provedores de IA, incluindo modelos hospedados pelo Zoom e parceiros selecionados de modelos de terceiros, para que as tarefas possam ser roteadas para o modelo mais adequado à solicitação. O ZM+ fornece um modelo de implantação mais controlado ao usar instâncias dedicadas de modelos gerenciadas pelo Zoom, enquanto o Somente Modelos Hospedados pelo Zoom (ZMO) mantém o processamento de IA apenas nos modelos hospedados pelo Zoom, oferecendo o caminho de modelo mais restritivo e controlado, porém com um conjunto de recursos mais limitado.

Para os fins desta página, os diagramas a seguir geralmente ilustram a abordagem federada, pois ela reflete a abordagem padrão do Zoom e a visão mais ampla da funcionalidade do Zoom AI. Organizações que usam ZM+ ou ZMO muitas vezes podem interpretar estes mesmos diagramas removendo mentalmente os provedores de modelos de IA de terceiros e concentrando-se nas partes restantes do fluxo gerenciadas pelo Zoom.

Consulte a página Zoom AI Models, Processing, Storage, and Usage para obter mais informações.

## Recursos e artefatos de mídia ao vivo

<div data-with-frame="true"><figure><img src="/files/512785222f3d591e850e43ad96810bc4cbfa3884" alt=""><figcaption><p>Visão geral de como a mídia ao vivo é transformada em dados de fala para texto que alimentam os recursos do Zoom AI</p></figcaption></figure></div>

O diagrama acima ilustra como interações de mídia ao vivo — como reuniões e chamadas telefônicas — podem produzir recursos e artefatos com IA subsequentes em toda a plataforma Zoom. Em cada caso, o áudio ao vivo entra no Zoom pelo ponto de conexão associado a esse produto ou serviço. Para reuniões, isso geralmente é o **Multimedia Router (MMR)**. Para telefonia, o áudio normalmente entra por meio de **zonas SIP**.

Assim que o áudio é ingerido, ele é encaminhado para o **Automatic Speech Recognition (ASR)** serviço, que converte o áudio ao vivo em **dados de fala para texto**. Esses dados de fala para texto podem ser usados de várias maneiras, dependendo das configurações e dos recursos ativados. Em alguns casos, eles são entregues imediatamente aos usuários como **legendas ao vivo**. Em contextos compatíveis, também pode ser passado para o **Live Translation** serviço, que traduz a saída de fala para texto em legendas traduzidas para participantes em outros idiomas.

Os dados de fala para texto também podem dar suporte a recursos mais persistentes ou derivados. Se **transcrição** estiver ativada, ou se um usuário estiver usando **Minhas Notas**, o serviço ASR pode produzir uma transcrição após a conclusão da sessão ao vivo. Se a retenção de transcrição não estiver ativada, no entanto, os dados de fala para texto usados durante a interação não são retidos como uma transcrição persistente. Mesmo nesses casos, o Zoom AI ainda pode usar os dados de fala para texto de forma efêmera durante a sessão para dar suporte a recursos de IA ao vivo.

Por exemplo, um usuário pode fazer **perguntas na reunião** ao Zoom AI durante uma reunião. Nesse caso, o Zoom AI pode usar os dados de fala para texto ao vivo da reunião para interpretar a pergunta do usuário e gerar uma resposta relevante fundamentada na conversa em andamento.

Uma distinção importante neste fluxo é que o Zoom AI não necessariamente retém uma transcrição da conversa apenas porque dados de fala para texto foram usados durante a sessão. A menos que a retenção de transcrição esteja especificamente ativada, ou que os dados estejam sendo retidos por meio de um recurso como **Minhas Notas**, os próprios dados de fala para texto podem permanecer efêmeros. Ao mesmo tempo, alguns artefatos subsequentes produzidos a partir desses dados podem persistir. Por exemplo, se um usuário fizer perguntas durante uma reunião, a conversa de IA resultante ou notas relacionadas podem posteriormente permanecer disponíveis como um artefato retido, mesmo quando uma transcrição persistente não é produzida.

Alguns artefatos retidos também podem se tornar a base para artefatos e fluxos de trabalho subsequentes adicionais. Um resumo da reunião, um resumo do webinar, um resumo da chamada ou as Minhas Notas de um usuário podem ser convertidos em um **Zoom Canvas** documento, onde ele pode continuar a ser editado, expandido e usado como um artefato de trabalho. Por sua vez, esses documentos resultantes podem posteriormente servir como contexto para outros recursos de IA ou fluxos de trabalho discutidos em outra parte deste documento. Dessa forma, o áudio ao vivo pode levar não apenas a recursos de IA imediatos, mas também a uma cadeia de artefatos retidos que continuam a dar suporte a trabalhos posteriores assistidos por IA em toda a plataforma Zoom.

Este diagrama se aplica aos seguintes recursos:

|            Recurso            |                                                Descrição                                                |     Produto(s)     | Retenção de artefatos |
| :---------------------------: | :-----------------------------------------------------------------------------------------------------: | :----------------: | :-------------------: |
|        Legendas ao vivo       |                     Legendas de fala para texto em tempo real para sessões ao vivo.                     | Reuniões, Webinars |       Não retido      |
|      legendas traduzidas      |         Legendas traduzidas em tempo real geradas a partir de dados de fala para texto ao vivo.         | Reuniões, Webinars |       Não retido      |
|          Transcrições         |                  Registros de texto retidos do conteúdo de fala para texto da reunião.                  | Reuniões, Telefone |         Retido        |
|       resumo da reunião       |      Resumo gerado por IA dos principais pontos da discussão da reunião, decisões e itens de ação.      |      Reuniões      |         Retido        |
|       Resumo do webinar       |            Resumo gerado por IA do conteúdo principal do webinar compartilhado após a sessão.           |      Webinars      |         Retido        |
|        Resumo de ligar        |                 Resumo pós-ligar gerado por IA dos principais detalhes e itens de ação.                 |      Telefone      |         Retido        |
|          Minhas Notas         | Notas pessoais, transcrição e contexto da reunião retidos para referência e acompanhamento posteriores. |      Reuniões      |         Retido        |
|    Itens de acompanhamento    |               Ações de acompanhamento sugeridas por IA com base nos detalhes da conversa.               |     Zoom Tasks     |         Retido        |
| Priorização do correio de voz |          Classificação baseada em IA de mensagens de voz por importância definida pelo usuário.         |      Telefone      |         Retido        |
|      Perguntas da reunião     |              Respostas de IA às perguntas da reunião usando o contexto da reunião ao vivo.              |      Reuniões      |         Retido        |
|      Perguntas do webinar     |             Respostas de IA para perguntas do webinar usando o contexto do webinar ao vivo.             |      Webinars      |         Retido        |
|     Perguntas sobre ligar     |              Respostas de IA para perguntas sobre ligar usando o contexto de ligar ao vivo.             |      Telefone      |         Retido        |

## Recursos de gravação

<div data-with-frame="true"><figure><img src="/files/d0961e9c0f3ac63d5b163af12817402aa21b20ff" alt=""><figcaption><p>Visão geral de como o Zoom processa gravações e recursos de IA</p></figcaption></figure></div>

O diagrama acima ilustra como o Zoom AI oferece suporte a **recursos de IA baseados em gravação** ao operar na gravação concluída após o término da sessão ao vivo. Assim como em outras experiências do Zoom baseadas em áudio, a mídia original entra pela infraestrutura associada ao produto em uso—como a **MMR** para reuniões ou a relevante **zona SIP** para telefonia. Como parte desse fluxo, a gravação é criada e enviada ao serviço de gravação do Zoom, onde a gravação concluída é então armazenada no armazenamento de conteúdo do Zoom.

Assim que a gravação é finalizada, o áudio associado a essa gravação é enviado ao **Automatic Speech Recognition (ASR)** serviço do Zoom para transcrição. Esse processo produz uma **transcrição específica da gravação**, que pode diferir dos dados de fala para texto gerados durante a própria sessão ao vivo. Em outras palavras, a transcrição associada a uma gravação concluída é gerada como parte do fluxo de processamento pós-gravação, em vez de simplesmente ser copiada da camada de interação ao vivo.

Após a produção da transcrição da gravação, ela pode então ser enviada para **Zoom AI** para análise adicional. Nesta etapa, o Zoom AI processa a transcrição para identificar artefatos de gravação de nível superior, como resumos, destaques, capítulos e outras representações estruturadas da conversa. Essa análise é realizada usando a camada de processamento de IA do Zoom, incluindo modelos hospedados pelo Zoom quando aplicável, para transformar a transcrição bruta da gravação em resultados pós-reunião ou pós-ligar mais úteis.

Uma vez concluída essa análise, os artefatos gerados por IA resultantes são associados à própria gravação. Isso permite que os usuários que visualizam uma gravação vejam não apenas a gravação e a transcrição, mas também as camadas adicionais geradas por IA que facilitam a navegação e a compreensão do conteúdo. Dessa forma, o diagrama mostra como uma gravação concluída pode se tornar a base para uma segunda etapa de processamento de IA, produzindo recursos de gravação enriquecidos que vão além da mídia armazenada original.

Este diagrama se aplica aos seguintes recursos:

|                      Recurso                      |                                                                     Descrição                                                                    |  Produto(s) | Retenção de artefatos |
| :-----------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------: | :---------: | :-------------------: |
|                Gravação inteligente               |                                       Destaques, capítulos e resumos gerados por IA para reuniões gravadas                                       |   Reuniões  |         Retido        |
|          Gerar títulos, descrições e tags         |                                              Títulos, descrições e tags gerados por IA para clipes.                                              |    Clipes   |         Retido        |
| Criação de conteúdo de IA para gravações e vídeos | Usa transcrições de gravações de Evento para gerar conteúdo escrito e trechos de vídeo selecionados por IA a partir de momentos-chave da sessão. | Zoom Events |         Retido        |

## Recursos derivados de IA

<div data-with-frame="true"><figure><img src="/files/10260be55cf100b012c9fd2f64db32f628305fa4" alt=""><figcaption><p>Visão geral de como o Zoom processa recursos de geração de conteúdo de IA derivada</p></figcaption></figure></div>

O diagrama acima ilustra como **funcionalidades derivadas de IA** opera utilizando conteúdo do usuário Disponível como contexto para tarefas e resultados assistidos por IA posteriores. Nesses casos, Zoom AI já não მუშაობa apenas com dados de interação ao vivo. Em vez disso, recorre a artefatos que já existem no ambiente de conteúdo mais amplo do usuário para responder a uma pergunta, sintetizar informações ou ajudar a produzir um novo resultado.

Dependendo da tarefa, este material contextual pode incluir artefatos como mensagens do chat, resumos de reunião, My Notes, transcrições, documentos do Zoom Canvas, apresentações (slide decks) do Zoom Slide, documentos do Zoom Paper, conteúdo do Zoom Mail ou do Zoom Calendar, dados de e-mail ou de calendário de terceiros conectados, ou arquivos enviados pelo usuário para dar Suporte a uma solicitação específica. Dessa forma, o Zoom AI está usando artefatos do Zoom criados anteriormente, juntamente com dados pessoais integrados quando disponíveis, para ajudar a alcançar o resultado final solicitado por um usuário.

O diagrama também reflete que este processo pode, por si só, gerar **novo conteúdo do usuário**. Por exemplo, o Zoom AI pode usar materiais existentes para criar uma nova Planilha do Zoom, um documento do Zoom Canvas, uma apresentação de slides do Zoom ou um documento do Zoom Paper. Depois de criados, esses novos artefatos passam a fazer parte do repositório de conteúdo mais amplo do usuário e podem posteriormente ser usados novamente como contexto para futuras funções e fluxos de trabalho assistidos por IA. Isso cria uma progressão em camadas na qual o conteúdo anterior do usuário pode Suporte resultados posteriores, e esses resultados, por sua vez, podem se tornar novos artefatos contextuais ao longo do tempo.

Esse mesmo padrão também pode aparecer em outras superfícies do Zoom. Em ambientes como **Zoom hub** ou o **painel de chat de IA**, os usuários podem fazer perguntas em toda a plataforma ou interagir com documentos e materiais disponíveis por meio da suíte de produtividade de IA do Zoom. Nesses casos, o Zoom AI está novamente trabalhando a partir de artefatos existentes acessíveis ao usuário para fornecer recuperação, síntese, პასუხa a perguntas ou acompanhamento, mostrando como os recursos de IA derivados ampliam o valor do conteúdo anterior para novas tarefas e resultados.

{% hint style="info" %}
**Nota**

Carregamentos de arquivos locais do usuário [podem ser desativados](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

Este diagrama se aplica aos seguintes recursos:

|        Recurso       |                                                                               Descrição                                                                               |            Produto(s)            | Retenção de artefatos |
| :------------------: | :-------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :------------------------------: | :-------------------: |
|  Geração de conteúdo | A geração de conteúdo usa IA para criar, refinar, resumir e organizar documentos, apresentações, planilhas e outras saídas a partir de comandos em linguagem natural. | Canvas, Planilhas, Paper, Slides |         Retido        |
| painel de chat de IA |                        Assistência conversacional de IA para fazer perguntas, gerar conteúdo e trabalhar em todo o contexto Disponível do Zoom.                       |       painel de chat de IA       |         Retido        |
|    Fazer perguntas   |                                         Respostas geradas por IA com base em documentos e materiais selecionados no Zoom hub.                                         |                hub               |         Retido        |

## Funcionalidades Generativas e de Composição

<div data-with-frame="true"><figure><img src="/files/15b58ddc6f9cee389d9a794d49da6537361e0beb" alt=""><figcaption><p>Visão geral de como o Zoom processa solicitações de IA generativa e de composição</p></figcaption></figure></div>

O diagrama acima ilustra como **funcionalidades generativas e de composição** operar dentro da plataforma Zoom AI. Ao contrário dos recursos de IA derivados, que dependem de conteúdo pré-existente do usuário para ajudar a alcançar uma tarefa ou resultado posterior, os recursos generativos e de composição são frequentemente impulsionados mais diretamente pela entrada imediata do usuário. Em muitos casos, esses recursos não dependem de artefatos Zoom retidos já armazenados em outro lugar no ambiente de conteúdo do usuário. Em vez disso, eles são alimentados principalmente por prompts diretos do usuário, consultas, arquivos carregados ou pelo conteúdo imediato na tela associado à experiência do produto Ativo.

Essa distinção é especialmente importante para funcionalidades que funcionam a partir do conteúdo visível no contexto atual do usuário, em vez de a partir de artefatos previamente indexados ou retidos. Por exemplo, quando um usuário resume uma thread de chat, resume um e-mail ou pede ao Zoom AI para redigir uma resposta a um e-mail, o conteúdo relevante é normalmente retirado do contexto ativo do cliente e empacotado em uma carga útil de solicitação para processamento pelo Zoom AI. Em outras palavras, o Zoom não está necessariamente recuperando esse conteúdo de um repositório separado no lado do servidor para realizar a tarefa. Em vez disso, as informações relevantes da thread ativa, do conjunto de mensagens ou de outro contexto visível da interface são convertidas em forma de texto e enviadas ao Zoom AI a partir do aplicativo Zoom Workplace, para que o serviço possa executar processamento de linguagem natural, sumarização ou geração.

O diagrama também inclui casos de uso generativos que dependem principalmente de instrução direta do usuário, em vez de material de origem textual. Por exemplo, quando um usuário solicita a geração de imagens, o usuário descreve o resultado desejado por meio de um prompt, e o modelo gera a imagem com base nessa descrição. Em alguns contextos de produto, como o Zoom Whiteboard, essa geração de imagens pode depender de provedores de modelos de IA de terceiros. Em outros contextos, o Zoom pode usar seus próprios modelos hospedados. Por exemplo, a geração de imagens do plano de fundo virtual do Zoom pode depender de um modelo hospedado no Zoom que usa embeddings e processamento relacionado para gerar saídas visuais, e o conteúdo resultante passa por controles de moderação antes de ser devolvido ao usuário.

Tomados em conjunto, o diagrama mostra que os recursos generativos e de composição muitas vezes dependem menos de artefatos retidos e mais da intenção imediata do usuário, do contexto Ativo do lado do cliente ou de materiais de apoio enviados. Dessa forma, eles representam outro modo importante de operação do Zoom AI: não apenas recuperar e raciocinar com base em conteúdo anterior, mas também gerar novos resultados diretamente a partir da solicitação atual do usuário e do contexto ao redor.

Este diagrama se aplica aos seguintes recursos:

|                Recurso                |                                                                                           Descrição                                                                                          |         Produto(s)         | Retenção de artefatos |
| :-----------------------------------: | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :------------------------: | :-------------------: |
|         plano de fundo virtual        |                                Usa IA para criar imagens personalizadas de plano de fundo virtual a partir de prompts do usuário para uso em sessões do Zoom.                                | Reuniões, Eventos, webinar |   Retido (se salvo)   |
|           Geração de imagens          |                   Usa IA para transformar desenhos no quadro de compartilhamento ou artefatos visuais brutos em saídas visuais mais refinadas, renderizadas ou estilizadas.                  | quadro de compartilhamento |   Retido (se salvo)   |
|           Geração de imagens          |                        Usa IA para criar imagens com a marca e outros ativos visuais para eventos, como cabeçalhos, imagens da sessão e materiais relacionados à expo.                       |           Eventos          |   Retido (se salvo)   |
|          Geração de conteúdo          | Usa IA para gerar conteúdo do quadro de compartilhamento na tela, como texto, notas adesivas, tabelas, mapas mentais e outros elementos visuais estruturados a partir de prompts do usuário. | quadro de compartilhamento |   Retido (se salvo)   |
|          Geração de conteúdo          |                              Usa IA para gerar conteúdo escrito do Evento, como descrições, detalhes da sessão, biografias de palestrantes e anúncios do saguão.                             |           Eventos          |   Retido (se salvo)   |
|           redação de e-mail           |                                      Usa IA para redigir e refinar o conteúdo do e-mail, incluindo corpos das mensagens, linhas de assunto e respostas.                                      |           e-mail           |  Retido (se enviado)  |
|            redação de chat            |                                     Usa IA para redigir e revisar mensagens de chat com base nos prompts do usuário e no contexto de conversa Disponível.                                    |            chat            |  Retido (se enviado)  |
|            Resumo de e-mail           |                                                          Usa IA para resumir o conteúdo principal de um e-mail ou thread de e-mail.                                                          |           e-mail           |       Não retido      |
| Mensagem, Thread, Resumo de documento |                                  Usa IA para resumir mensagens de chat, threads de conversa e documentos anexados compatíveis ou conteúdo Canvas vinculado.                                  |            chat            |       Não retido      |
|           Upload inteligente          |                               Extrai detalhes do evento de arquivos carregados para construir automaticamente sessões, palestrantes e perguntas personalizadas.                              |         Zoom Events        |   Retido (se salvo)   |

## Minhas Notas

### Minhas Notas no Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/74f0f1523ca48a07330a4f91454f36d8b2ae23ba" alt=""><figcaption><p>Visão geral dos fluxos de dados do My Notes em Zoom Meetings</p></figcaption></figure></div>

O diagrama acima mostra como, dentro do Zoom Meetings, o My Notes usa o caminho de áudio existente da reunião em vez de depender de outro áudio presente no Dispositivo do usuário. Quando o My Notes é ativado durante uma reunião no Zoom Meetings, ele acessa o áudio da reunião compartilhado roteado pela sessão de Multi-Media Router (MMR) da reunião. Esse áudio é então processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao Dispositivo do usuário e pode depois dar suporte à geração de notas pós-reunião.

Neste fluxo, a transcrição baseia-se especificamente no áudio da reunião do Zoom associado a essa sessão da reunião. Ela não se baseia em áudio local irrelevante do Dispositivo fora da própria reunião. Após o término da reunião, a transcrição e as notas resultantes podem permanecer Disponível de acordo com as Configurações de retenção aplicáveis do usuário, enquanto o áudio subjacente usado para a transcrição não é retido após a conclusão do processamento.

### My Notes fora do Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/1f3ef03a45a218fc4246acb2e816cbdb08aab700" alt=""><figcaption><p>Visão geral dos fluxos de dados do My Notes fora do Zoom Meetings</p></figcaption></figure></div>

O diagrama acima mostra como, fora do Zoom Meetings, o My Notes opera por meio do áudio do dispositivo local do usuário em vez de por meio de uma sessão compartilhada do Zoom. Se ativado durante uma reunião de terceiros ou uma discussão presencial, o My Notes pode usar acesso em nível do sistema ao microfone do usuário e, quando aplicável, ao áudio do sistema para capturar o áudio do dispositivo disponível nesse Dispositivo. Esse áudio é então roteado por meio de uma sessão MMR de usuário único e processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao Dispositivo do usuário e pode depois dar suporte à geração de notas pós-reunião.

Isso significa que, fora do Zoom Meetings, a transcrição baseia-se exclusivamente no áudio transmitido a partir do Dispositivo local do usuário, e não de um fluxo compartilhado de áudio da reunião do Zoom. O My Notes também pode solicitar que o usuário inicie uma nova nota quando a atividade do microfone do Dispositivo é detectada, ajudando a destacar os Recursos em situações como reuniões de terceiros, gravações baseadas no navegador ou outros fluxos de trabalho com microfone ativo. Assim como no fluxo durante a reunião, o áudio usado para a transcrição não é retido após a conclusão da transcrição, enquanto as notas e transcrições resultantes podem permanecer salvas na conta do usuário de acordo com as Configurações de retenção aplicáveis.

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/95d959a5950a2e5d70b73d6fd288be71625fef2b" alt=""><figcaption><p>Visão geral dos fluxos de dados do ZoomMate</p></figcaption></figure></div>

O diagrama acima ilustra como **ZoomMate funciona como uma superfície de trabalho principal no Zoom Workplace**, operando no ponto em que o contexto do usuário, o conhecimento conectado e as capacidades de execução se unem. Em vez de existir apenas como um assistente independente, o ZoomMate fica no centro de um ambiente de trabalho mais amplo no qual os usuários podem pesquisar, raciocinar, criar e agir sobre os materiais e sistemas que apoiam seu trabalho diário.

Uma parte importante dessa Função decorre do Acessar do ZoomMate a **conteúdo de primeira parte do Zoom**. Isso pode incluir artefatos como resumos, My Notes, gravações, documentos do Canvas, mensagens de chat e outros materiais gerados pelo usuário criados na plataforma Zoom. Esses artefatos ajudam a fornecer ao ZoomMate o contexto de que ele precisa para responder perguntas, sintetizar informações, gerar resultados e apoiar o acompanhamento. O ZoomMate também pode usar **memória**, permitindo que ele incorpore preferências relevantes do usuário ou detalhes relacionados ao trabalho ao ajudar a concluir uma tarefa.

O diagrama também mostra como o ZoomMate vai além do conteúdo nativo do Zoom ao se integrar com **fontes de conhecimento de terceiros**. Por exemplo, serviços conectados de Armazenamento em nuvem, como Google Drive ou OneDrive, podem servir como repositórios externos de informações acessíveis ao usuário. Quando essas fontes são integradas, o Zoom pode indexar conteúdo aprovado para dar suporte à recuperação desses materiais, permitindo que o ZoomMate use **busca agentiva** para atuar tanto no conteúdo do Zoom quanto no conhecimento conectado de terceiros. Dessa forma, o ZoomMate pode pesquisar não apenas o que existe dentro do Zoom, mas também os documentos e materiais aos quais um usuário está autorizado a acessar em plataformas externas conectadas.

Outras fontes de dados pessoais, como **e-mail e calendário** (excluindo e-mails criptografados de ponta a ponta), também podem dar suporte ao ZoomMate, mas funcionam de maneira diferente. Em vez de serem indexadas, essas fontes geralmente se comunicam com o ZoomMate por meio de recuperação direta baseada em API. Isso as torna úteis para tarefas como localizar contexto relevante do e-mail, revisar informações do calendário ou ajudar a Agendar eventos, sem tratá-las como parte da camada de recuperação indexada usada para uma pesquisa mais ampla de documentos.

O diagrama também mostra que o ZoomMate pode se conectar a uma gama mais ampla de **serviços e conectores de terceiros** que dão suporte à execução de ações, bem como ao acesso a conhecimento. Isso pode incluir sistemas como Jira, HubSpot, ServiceNow, Workday e outras plataformas corporativas conectadas. Por meio dessas conexões, o ZoomMate pode executar **tarefas agentivas** em nome do usuário, como criar ou atualizar registros, recuperar informações de serviços externos ou executar outras ações conectadas nesses sistemas. Isso faz do ZoomMate mais do que uma superfície de recuperação e síntese; ele também funciona como uma camada de execução que pode ajudar a transformar contexto em ação.

Essa mesma base também ajuda a impulsionar **agentes** e **fluxos de trabalho** dentro do ambiente do ZoomMate. Os agentes podem usar o mesmo contexto subjacente, caminhos de recuperação e sistemas conectados para fornecer uma assistência mais dinâmica, baseada em raciocínio, ajudando os usuários a realizar tarefas mais amplas de várias etapas com maior continuidade e adaptabilidade. Os fluxos de trabalho, em contrapartida, podem oferecer uma automação mais estruturada e repetível, permitindo que os usuários definam processos recorrentes que operam em conteúdos do Zoom e, quando houver Suporte, em sistemas externos conectados. Dessa forma, o ZoomMate serve não apenas como uma interface conversacional, mas também como um ponto de orquestração tanto para atividade agentiva dinâmica quanto para automação mais estruturada.

**Sandbox** também pode dar Suporte a algumas das capacidades de execução mais avançadas do ZoomMate. Para tarefas que exigem execução de código, geração de arquivos, automação ou outro processamento mais sofisticado, o ZoomMate pode usar um ambiente sandbox separado, em vez de depender apenas do processamento conversacional padrão. Essa sandbox é executada na infraestrutura AWS da Zoom e fornece uma camada de execução isolada e de curta duração para tarefas de maior complexidade, ajudando o ZoomMate a realizar determinadas operações em um ambiente mais controlado. Dessa forma, a mesma base mais ampla do ZoomMate que dá Suporte à recuperação, ao raciocínio, aos agentes e aos fluxos de trabalho também pode dar Suporte à execução de tarefas mais avançadas quando o trabalho solicitado exigir isso.

Por fim, o diagrama não representa todos os componentes subjacentes que ajudam a dar Suporte ao ZoomMate. Ele não foi feito para Mostrar explicitamente camadas de capacidade fundamentais, como skills, ou outras estruturas de Suporte que fazem parte da infraestrutura e do design mais amplos do Zoom AI. Presume-se que esses elementos operem dentro do sistema de IA subjacente que permite o comportamento do ZoomMate. O objetivo deste diagrama é, em vez disso, Mostrar os principais contextos, conhecimentos e superfícies de ação por meio dos quais o ZoomMate funciona como uma superfície de trabalho unificada em todo o Zoom e em sistemas conectados.

### Conexões e Indexação de Terceiros do ZoomMate

<figure><img src="/files/d1d06f76f22b359bf0276c332b6a0179e778a7e4" alt="" width="375"><figcaption><p>Visão geral de como o ZoomMate se conecta a conexões de terceiros e fontes de dados</p></figcaption></figure>

O diagrama acima ilustra duas partes relacionadas, mas distintas, da arquitetura de dados de terceiros do ZoomMate. A primeira é como o ZoomMate se conecta a aplicativos e serviços de terceiros suportados para que possa recuperar informações ou tomar ações dentro desses sistemas. A segunda é como certas fontes de conteúdo de terceiros suportadas podem ser ingeridas e indexadas para que o ZoomMate possa depois recuperar esse conteúdo de forma mais eficiente por meio de geração aumentada por recuperação.

#### <mark style="color:azul;">O ZoomMate pode conectar-se diretamente a aplicativos e serviços de terceiros</mark>

Uma parte do diagrama mostra como o ZoomMate se conecta a aplicativos de terceiros suportados, como Jira, Confluence, Salesforce, ServiceNow, Workday, plataformas de Armazenamento em nuvem e outros sistemas empresariais externos. Essas conexões permitem que o ZoomMate opere além do conteúdo nativo do Zoom, interagindo com ferramentas que armazenam dados empresariais ou dão suporte ao trabalho operacional fora da plataforma Zoom.

Essas conexões são estabelecidas por meio de uma conexão TLS através de modelos de acesso autorizados, como integrações baseadas em API ou conexões baseadas em MCP. Em qualquer caso, o ZoomMate opera dentro das Permissões concedidas pelo serviço conectado. Isso permite que o ZoomMate recupere informações relevantes desses sistemas e, quando suportado, tome ações neles em nome do usuário. Por exemplo, o ZoomMate pode recuperar detalhes de um issue do Jira, pesquisar uma página do Confluence, atualizar um registro no ServiceNow ou usar outro sistema conectado como parte da execução de uma tarefa mais ampla.

Esse modelo de conexão direta é especialmente importante para tarefas que dependem do estado atual do sistema ou de acesso ao vivo a ferramentas de terceiros. Nesses casos, o ZoomMate pode usar o aplicativo conectado como um ponto de extremidade de serviço Ativo, em vez de apenas como um repositório de conteúdo previamente indexado.

#### <mark style="color:azul;">O ZoomMate pode indexar conteúdo de terceiros aprovado para recuperação posterior</mark>

Uma segunda parte do diagrama mostra como o ZoomMate pode ingerir e indexar conteúdo de fontes de terceiros suportadas para que o material possa ser recuperado posteriormente como parte de uma pesquisa ou de uma resposta assistida por IA. Esse modelo de recuperação indexada é mais relevante para repositórios de conteúdo conectados, como sistemas de Armazenamento em nuvem, bases de conhecimento, plataformas de documentos e outras fontes suportadas nas quais o ZoomMate pode precisar pesquisar um volume maior de conteúdo externo retido.

Depois que uma fonte suportada é conectada e aprovada para indexação, o ZoomMate pode recuperar conteúdo dessa fonte e prepará-lo para pesquisa posterior. Esse processo de preparação pode incluir a divisão de arquivos ou registros maiores em unidades menores e a adição de metadados como origem, hora de atualização, propriedade e informações de Permissão. Em seguida, esse conteúdo é gravado na camada de indexação do Zoom para que possa ser pesquisado posteriormente tanto por correspondência exata quanto por recuperação baseada em significado.

Quando um usuário envia uma solicitação que depende de conteúdo de terceiros indexado, o ZoomMate pode pesquisar esse material indexado, avaliar quais resultados são mais relevantes e aplicar as informações de Permissão associadas à fonte original para que apenas conteúdo autorizado seja elegível para aparecer. O conteúdo autorizado mais relevante pode então ser passado para a camada de IA do ZoomMate como contexto de apoio para a resposta. Dessa forma, o diagrama mostra como o conteúdo de terceiros indexado pode ajudar o ZoomMate a produzir respostas fundamentadas em materiais empresariais conectados reais, em vez de depender apenas do conhecimento geral do modelo.

## Avatares personalizados

### Criação de avatar

<div data-with-frame="true"><figure><img src="/files/d2c1fa6249ead8991505fabf803a6d59cc3bac42" alt=""><figcaption><p>Visão geral do processo de criação de Avatar Personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como um avatar personalizado é criado a partir do vídeo e da voz gravados de um usuário. O processo começa quando o usuário recebe um roteiro e é solicitado a gravar-se lendo-o. Esta etapa de gravação guiada permite à Zoom capturar o material audiovisual necessário para gerar tanto a semelhança do avatar do usuário quanto o modelo de voz associado usado em saídas posteriores baseadas em avatar.

Após o usuário concluir a gravação, os componentes de áudio e vídeo são processados por caminhos diferentes. O áudio é enviado a um serviço terceirizado que gera uma semelhança de voz com base na fala gravada do usuário. Assim que esse processamento é concluído, o serviço terceirizado retorna à Zoom um identificador de voz exclusivo. A Zoom armazena esse identificador como a referência de voz do usuário para que ele possa ser usado posteriormente ao gerar clipes baseados em avatar ou outras saídas compatíveis que dependem dessa voz sintetizada.

Ao mesmo tempo, o componente de vídeo é enviado a um módulo de geração de avatar hospedado pela Zoom, onde a Zoom processa o material visual gravado para criar a representação de avatar do usuário. Isso resulta em um modelo de avatar que a Zoom armazena para uso futuro. Considerados em conjunto, esses dois resultados retidos — o identificador de voz armazenado e o modelo de avatar armazenado — servem para Permitir que a Zoom gere futuros clipes ou mídia baseada em avatar que reflitam tanto a semelhança do usuário quanto sua voz sintetizada.

### Criação de clipe

<div data-with-frame="true"><figure><img src="/files/8fe54ff5f0adefb5d4262aad650422ee2ade1b6b" alt=""><figcaption><p>Visão geral do processo de criação de clipe do Avatar Personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como um clipe de avatar personalizado é criado a partir do avatar armazenado e do perfil de voz sintetizada de um usuário. O processo começa quando o usuário envia o roteiro que quer apresentar por meio do avatar. Esse roteiro serve como o conteúdo de origem para o clipe gerado.\
\
A partir daí, o backend web da Zoom coordena duas entradas paralelas necessárias para criar o resultado final. Primeiro, ele envia o identificador de voz armazenado do usuário juntamente com o roteiro ao serviço terceirizado de geração de voz, que produz o áudio do clipe usando a voz sintetizada do usuário. Segundo, ele envia o modelo de avatar armazenado do usuário ao módulo de geração de avatar da Zoom para que o componente visual do clipe possa ser preparado usando a semelhança do avatar previamente criada do usuário.\
\
Assim que o serviço terceirizado de geração de voz produz o áudio, esse áudio é devolvido à Zoom e passado para o módulo de geração de avatar. O módulo de geração de avatar então combina o modelo de avatar armazenado com o áudio de voz gerado, sincronizando os movimentos faciais e da boca do avatar com o conteúdo falado. Após a conclusão desse processo de sincronização labial e renderização, a Zoom produz o clipe de avatar finalizado e o entrega de volta ao usuário.

## Dicionário personalizado

<div data-with-frame="true"><figure><img src="/files/375097cdc14f3a510953914c8a9e7a995a5816da" alt=""><figcaption><p>Fluxos de dados do dicionário personalizado</p></figcaption></figure></div>

O diagrama acima ilustra como a funcionalidade (Recursos) de Dicionário Personalizado ajuda a melhorar a precisão das saídas do Zoom baseadas em fala, fornecendo ao serviço de Reconhecimento Automático de Fala (ASR) do Zoom um contexto adicional de vocabulário. Esta funcionalidade foi projetada para dar suporte a palavras, abreviações, jargões, nomes de produtos ou terminologia especializada que podem ser específicos de uma empresa, setor, equipe ou região e que, de outra forma, poderiam não ser reconhecidos ou representados corretamente durante a transcrição.

O processo começa quando um administrador da conta cria e armazena um dicionário personalizado no Portal web do Zoom. Esse dicionário contém a lista de palavras ou frases aprovadas que a Organização deseja que o Zoom reconheça com mais precisão. Depois que o dicionário é salvo no nível da conta, ele se torna Disponível para uso em contextos suportados de reunião e de processamento de fala.

Quando um usuário inicia posteriormente uma reunião, o serviço AASR do Zoom pode receber o dicionário personalizado da conta como parte do seu contexto de processamento. À medida que o serviço ASR converte áudio ao vivo em dados de fala para texto, ele pode comparar a linguagem falada percebida com o dicionário personalizado e tentar mapear os sons reconhecidos aos termos armazenados. Isso fornece ao ASR orientação adicional sobre quais palavras procurar, como certos termos podem ser soletrados e como abreviações ou linguagem especializada devem ser interpretadas.

O resultado é que a saída inicial de fala para texto pode refletir com mais precisão a terminologia realmente usada na reunião. Essa precisão aprimorada pode então ser levada adiante para artefatos posteriores derivados da conversa. Por exemplo, se um resumo da reunião, legendas, transcrição ou outro ativo baseado em dados de fala para texto for gerado posteriormente, essas saídas podem refletir uma representação mais precisa das palavras faladas durante a reunião, ajudando a melhorar a qualidade e a utilidade do artefato gerado por IA resultante.

## Modelos personalizados de resumo da reunião

<div data-with-frame="true"><figure><img src="/files/1686ebc8927ffc8c618714f542c97654441d58c7" alt=""><figcaption><p>Fluxos de dados dos Modelos personalizados de resumo da reunião</p></figcaption></figure></div>

O diagrama acima ilustra como os resumos personalizados da reunião são gerados a partir de um modelo definido pelo usuário ou pela conta. O processo começa quando um modelo é criado e salvo no Zoom. No nível da conta, um administrador pode definir um modelo personalizado de resumo da reunião para uso organizacional. No nível individual, um usuário pode criar um modelo pessoal de resumo da reunião com base em suas próprias preferências. Uma vez criado, o modelo selecionado é armazenado para que possa ser aplicado durante a geração posterior do resumo.

À medida que uma reunião termina, o Zoom AI pode usar os dados de fala para texto da reunião para gerar um resumo que siga a estrutura e a ênfase do modelo personalizado escolhido. Se o modelo personalizado foi selecionado antes de o resumo da reunião ser gerado, o Zoom AI aplica esse modelo diretamente ao produzir o resumo. Isso permite que a saída resultante reflita o formato específico, as seções ou as prioridades definidas no modelo, em vez de apenas uma estrutura de resumo padrão.

Se um modelo personalizado não foi selecionado antes de o resumo ser gerado pela primeira vez, o Zoom só pode aplicar esse modelo mais tarde se a transcrição da reunião tiver sido retida. Nesse caso, o Zoom AI pode reprocessar a transcrição retida usando a configuração do modelo e produzir um novo resumo alinhado a essa estrutura. Se a transcrição não tiver sido retida, no entanto, o Zoom não tem a transcrição subjacente disponível para reprocessamento, o que significa que o modelo personalizado não pode ser aplicado posteriormente.

## Isolamento pessoal de áudio

<div data-with-frame="true"><figure><img src="/files/35efad202c50c597681aa60325c4b2bb48e3ebf5" alt=""><figcaption><p>Visão geral de como o Isolamento Pessoal de áudio isola a voz de um usuário</p></figcaption></figure></div>

O diagrama acima ilustra como **Isolamento pessoal de áudio** funciona usando um molde de voz armazenado localmente no Dispositivo do usuário para distinguir a fala do usuário do Ruído de fundo ao redor. O processo começa quando o usuário grava um exemplo de áudio por meio dos Recursos de Personal Audio Isolation no Zoom Workplace aplicativo. Essa gravação é usada para criar um molde de voz local que ajuda o aplicativo a reconhecer as características da voz do usuário. Esse molde de voz permanece na máquina local e não é transmitido para a Zoom cloud.

Quando o usuário fala mais tarde durante uma reunião em um ambiente com ruído ambiente, o aplicativo Zoom Workplace usa essa impressão vocal armazenada localmente para ajudar a identificar os padrões de fala do usuário e separá-los dos sons ao redor. Isso permite ao aplicativo: Reduzir ruído de fundo e isolar a voz do usuário de forma mais eficaz antes de o áudio ser enviado adiante pelo fluxo da reunião.

Como resultado, o áudio transmitido para a Zoom cloud é o áudio de reunião refinado, com ruído ambiente filtrado na medida suportada pelos Recursos. A própria marca de voz subjacente do usuário não é enviada para a infraestrutura de nuvem da Zoom. Dessa forma, o Personal Audio Isolation opera como um processamento local em nível de Dispositivo que melhora a clareza do áudio antes de o áudio limpo ser transmitido para a sessão Zoom ao vivo.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/pt/ai/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
