O conteúdo desta página foi traduzido automaticamente. A Zoom não garante a exatidão.
For the complete documentation index, see llms.txt. This page is also available as Markdown.

Diagramas e Fluxos de Dados

Diagramas e fluxos de dados do Zoom AI para Zoom Workplace, Webinars e Eventos

As capacidades de IA do Zoom abrangem uma ampla gama de produtos, serviços e fluxos de trabalho, o que significa que nenhum diagrama isolado consegue capturar de forma razoável ou completa como a IA funciona em toda a plataforma Zoom. Diferentes recursos dependem de diferentes entradas, caminhos de processamento, comportamentos de armazenamento, interações entre modelos e saídas. Alguns operam apenas em dados ao vivo e efêmeros durante uma interação ativa, enquanto outros criam artefatos retidos que podem posteriormente dar suporte a recursos adicionais. Algumas funções permanecem totalmente no ambiente de primeira parte do Zoom, enquanto outras dependem da arquitetura de IA federada do Zoom e, em alguns casos, de sistemas externos conectados. Para tornar esse sistema dinâmico e amplo mais fácil de entender, esta página apresenta uma série de diagramas em vez de depender de um único modelo visual. Cada um destaca uma camada, um caminho ou um padrão de recurso diferente dentro da plataforma Zoom AI mais ampla. Na parte inferior destas seções há tabelas que detalham quais recursos são aplicáveis, o produto associado e o status de retenção dos artefatos. As seções posteriores então examinam certos recursos de produto específicos individualmente, oferecendo explicações mais focadas sobre como essas capacidades específicas funcionam.

A sequência começa abaixo com uma visão geral simplificada do Zoom AI em sua forma mais básica, mostrando a plataforma em um estado centrado na própria Zoom que usa a arquitetura padrão de modelo federado do Zoom, mas ainda não introduz integrações empresariais de terceiros ou fontes externas de dados de clientes além dos provedores de modelos de IA de terceiros do Zoom. A partir daí, os diagramas introduzem gradualmente partes mais especializadas da plataforma, incluindo as opções de abordagem de IA do Zoom, a transformação de áudio ao vivo em artefatos utilizáveis pela IA e as formas pelas quais esses artefatos podem posteriormente dar suporte a outros recursos e fluxos de trabalho. Em conjunto, estes diagramas têm como objetivo tornar um sistema altamente complexo mais acessível, dividindo-o em visualizações menores e mais fáceis de acompanhar que refletem como diferentes partes da plataforma de IA do Zoom funcionam na prática.

Zoom AI

Uma visão geral simples do Zoom AI

O diagrama acima apresenta a plataforma de IA do Zoom em uma forma simplificada, mostrando a plataforma em um de seus estados mais fundamentais. Ele ilustra como diferentes partes da arquitetura mais ampla de produtos e serviços do Zoom, conhecida como back-end Web do Zoom — incluindo áreas como Reuniões, Phone, central de contato, reconhecimento automático de fala e outras ofertas do Zoom — alimentam a plataforma maior do Zoom e contribuem para o conjunto de conteúdo acessível ao usuário que pode dar suporte à funcionalidade de IA subsequente.

Um conceito central neste diagrama é conteúdo do usuário do Zoom. Isto se refere ao conteúdo gerado por meio das interações de um usuário com os produtos e serviços do Zoom, que pode posteriormente servir como entrada, contexto ou artefatos para experiências com IA. Dependendo do produto e do recurso envolvidos, isso pode incluir materiais como mensagens do Zoom Chat, resumos da reunião, transcrições, documentos do Canvas, Minhas Notas, gravações e outros artefatos semelhantes voltados ao usuário. Esses materiais formam uma parte importante da camada contextual que pode dar suporte posterior à recuperação assistida por IA, ao raciocínio, à sumarização e ao acompanhamento.

Parte desse conteúdo também pode ser preparada para uso futuro pela IA por meio de infraestrutura de recuperação, como recuperação indexada ou módulos de geração aumentada por recuperação. Nesses casos, os artefatos relevantes podem ser ingeridos e indexados para que possam ser localizados e usados com mais eficiência em consultas ou processos de IA posteriores. Isso ajuda o Zoom AI a მუშაობar não apenas com interações ao vivo, mas também com contexto retido e materiais gerados anteriormente pelo usuário em toda a plataforma.

Por fim, o diagrama também apresenta Zoom AI a si mesmo como a camada de IA compartilhada que opera em todo esse ecossistema mais amplo. Nesta visão simplificada, o Zoom AI é mostrado por meio da abordagem federada padrão do Zoom, na qual o Zoom pode usar tanto modelos hospedados pelo Zoom em execução na própria infraestrutura do Zoom quanto provedores selecionados de modelos de IA de terceiros, quando apropriado para a tarefa em questão. Esse modelo federado permite que o Zoom direcione tarefas de IA para o ambiente de modelo disponível mais adequado, mantendo uma experiência de IA unificada em toda a plataforma.

Abordagens do modelo de serviço do Zoom AI

Visão geral das abordagens de IA do Zoom, incluindo a Abordagem Federada, ZM+ e Somente Modelos Hospedados pelo Zoom (ZMO)

O diagrama acima ilustra as três abordagens de IA do Zoom: a Abordagem Federada, Modelos Hospedados pelo Zoom Plus (ZM+) e Somente Modelos Hospedados pelo Zoom (ZMO). Em conjunto, elas representam as três principais maneiras pelas quais o Zoom fornece serviços de IA aos clientes, cada uma oferecendo um equilíbrio diferente entre amplitude dos recursos, flexibilidade do modelo e controle dos dados.

A Abordagem Federada é a abordagem padrão do Zoom e a mais completa em termos de recursos. Ela permite que o Zoom trabalhe com vários provedores de IA, incluindo modelos hospedados pelo Zoom e parceiros selecionados de modelos de terceiros, para que as tarefas possam ser roteadas para o modelo mais adequado à solicitação. O ZM+ fornece um modelo de implantação mais controlado ao usar instâncias dedicadas de modelos gerenciadas pelo Zoom, enquanto o Somente Modelos Hospedados pelo Zoom (ZMO) mantém o processamento de IA apenas nos modelos hospedados pelo Zoom, oferecendo o caminho de modelo mais restritivo e controlado, porém com um conjunto de recursos mais limitado.

Para os fins desta página, os diagramas a seguir geralmente ilustram a abordagem federada, pois ela reflete a abordagem padrão do Zoom e a visão mais ampla da funcionalidade do Zoom AI. Organizações que usam ZM+ ou ZMO muitas vezes podem interpretar estes mesmos diagramas removendo mentalmente os provedores de modelos de IA de terceiros e concentrando-se nas partes restantes do fluxo gerenciadas pelo Zoom.

Consulte a página Zoom AI Models, Processing, Storage, and Usage para obter mais informações.

Recursos e artefatos de mídia ao vivo

Visão geral de como a mídia ao vivo é transformada em dados de fala para texto que alimentam os recursos do Zoom AI

O diagrama acima ilustra como interações de mídia ao vivo — como reuniões e chamadas telefônicas — podem produzir recursos e artefatos com IA subsequentes em toda a plataforma Zoom. Em cada caso, o áudio ao vivo entra no Zoom pelo ponto de conexão associado a esse produto ou serviço. Para reuniões, isso geralmente é o Multimedia Router (MMR). Para telefonia, o áudio normalmente entra por meio de zonas SIP.

Assim que o áudio é ingerido, ele é encaminhado para o Automatic Speech Recognition (ASR) serviço, que converte o áudio ao vivo em dados de fala para texto. Esses dados de fala para texto podem ser usados de várias maneiras, dependendo das configurações e dos recursos ativados. Em alguns casos, eles são entregues imediatamente aos usuários como legendas ao vivo. Em contextos compatíveis, também pode ser passado para o Live Translation serviço, que traduz a saída de fala para texto em legendas traduzidas para participantes em outros idiomas.

Os dados de fala para texto também podem dar suporte a recursos mais persistentes ou derivados. Se transcrição estiver ativada, ou se um usuário estiver usando Minhas Notas, o serviço ASR pode produzir uma transcrição após a conclusão da sessão ao vivo. Se a retenção de transcrição não estiver ativada, no entanto, os dados de fala para texto usados durante a interação não são retidos como uma transcrição persistente. Mesmo nesses casos, o Zoom AI ainda pode usar os dados de fala para texto de forma efêmera durante a sessão para dar suporte a recursos de IA ao vivo.

Por exemplo, um usuário pode fazer perguntas na reunião ao Zoom AI durante uma reunião. Nesse caso, o Zoom AI pode usar os dados de fala para texto ao vivo da reunião para interpretar a pergunta do usuário e gerar uma resposta relevante fundamentada na conversa em andamento.

Uma distinção importante neste fluxo é que o Zoom AI não necessariamente retém uma transcrição da conversa apenas porque dados de fala para texto foram usados durante a sessão. A menos que a retenção de transcrição esteja especificamente ativada, ou que os dados estejam sendo retidos por meio de um recurso como Minhas Notas, os próprios dados de fala para texto podem permanecer efêmeros. Ao mesmo tempo, alguns artefatos subsequentes produzidos a partir desses dados podem persistir. Por exemplo, se um usuário fizer perguntas durante uma reunião, a conversa de IA resultante ou notas relacionadas podem posteriormente permanecer disponíveis como um artefato retido, mesmo quando uma transcrição persistente não é produzida.

Alguns artefatos retidos também podem se tornar a base para artefatos e fluxos de trabalho subsequentes adicionais. Um resumo da reunião, um resumo do webinar, um resumo da chamada ou as Minhas Notas de um usuário podem ser convertidos em um Zoom Canvas documento, onde ele pode continuar a ser editado, expandido e usado como um artefato de trabalho. Por sua vez, esses documentos resultantes podem posteriormente servir como contexto para outros recursos de IA ou fluxos de trabalho discutidos em outra parte deste documento. Dessa forma, o áudio ao vivo pode levar não apenas a recursos de IA imediatos, mas também a uma cadeia de artefatos retidos que continuam a dar suporte a trabalhos posteriores assistidos por IA em toda a plataforma Zoom.

Este diagrama se aplica aos seguintes recursos:

Recurso
Descrição
Produto(s)
Retenção de artefatos

Legendas ao vivo

Legendas de fala para texto em tempo real para sessões ao vivo.

Reuniões, Webinars

Não retido

legendas traduzidas

Legendas traduzidas em tempo real geradas a partir de dados de fala para texto ao vivo.

Reuniões, Webinars

Não retido

Transcrições

Registros de texto retidos do conteúdo de fala para texto da reunião.

Reuniões, Telefone

Retido

resumo da reunião

Resumo gerado por IA dos principais pontos da discussão da reunião, decisões e itens de ação.

Reuniões

Retido

Resumo do webinar

Resumo gerado por IA do conteúdo principal do webinar compartilhado após a sessão.

Webinars

Retido

Resumo de ligar

Resumo pós-ligar gerado por IA dos principais detalhes e itens de ação.

Telefone

Retido

Minhas Notas

Notas pessoais, transcrição e contexto da reunião retidos para referência e acompanhamento posteriores.

Reuniões

Retido

Itens de acompanhamento

Ações de acompanhamento sugeridas por IA com base nos detalhes da conversa.

Zoom Tasks

Retido

Priorização do correio de voz

Classificação baseada em IA de mensagens de voz por importância definida pelo usuário.

Telefone

Retido

Perguntas da reunião

Respostas de IA às perguntas da reunião usando o contexto da reunião ao vivo.

Reuniões

Retido

Perguntas do webinar

Respostas de IA para perguntas do webinar usando o contexto do webinar ao vivo.

Webinars

Retido

Perguntas sobre ligar

Respostas de IA para perguntas sobre ligar usando o contexto de ligar ao vivo.

Telefone

Retido

Recursos de gravação

Visão geral de como o Zoom processa gravações e recursos de IA

O diagrama acima ilustra como o Zoom AI oferece suporte a recursos de IA baseados em gravação ao operar na gravação concluída após o término da sessão ao vivo. Assim como em outras experiências do Zoom baseadas em áudio, a mídia original entra pela infraestrutura associada ao produto em uso—como a MMR para reuniões ou a relevante zona SIP para telefonia. Como parte desse fluxo, a gravação é criada e enviada ao serviço de gravação do Zoom, onde a gravação concluída é então armazenada no armazenamento de conteúdo do Zoom.

Assim que a gravação é finalizada, o áudio associado a essa gravação é enviado ao Automatic Speech Recognition (ASR) serviço do Zoom para transcrição. Esse processo produz uma transcrição específica da gravação, que pode diferir dos dados de fala para texto gerados durante a própria sessão ao vivo. Em outras palavras, a transcrição associada a uma gravação concluída é gerada como parte do fluxo de processamento pós-gravação, em vez de simplesmente ser copiada da camada de interação ao vivo.

Após a produção da transcrição da gravação, ela pode então ser enviada para Zoom AI para análise adicional. Nesta etapa, o Zoom AI processa a transcrição para identificar artefatos de gravação de nível superior, como resumos, destaques, capítulos e outras representações estruturadas da conversa. Essa análise é realizada usando a camada de processamento de IA do Zoom, incluindo modelos hospedados pelo Zoom quando aplicável, para transformar a transcrição bruta da gravação em resultados pós-reunião ou pós-ligar mais úteis.

Uma vez concluída essa análise, os artefatos gerados por IA resultantes são associados à própria gravação. Isso permite que os usuários que visualizam uma gravação vejam não apenas a gravação e a transcrição, mas também as camadas adicionais geradas por IA que facilitam a navegação e a compreensão do conteúdo. Dessa forma, o diagrama mostra como uma gravação concluída pode se tornar a base para uma segunda etapa de processamento de IA, produzindo recursos de gravação enriquecidos que vão além da mídia armazenada original.

Este diagrama se aplica aos seguintes recursos:

Recurso
Descrição
Produto(s)
Retenção de artefatos

Gravação inteligente

Destaques, capítulos e resumos gerados por IA para reuniões gravadas

Reuniões

Retido

Gerar títulos, descrições e tags

Títulos, descrições e tags gerados por IA para clipes.

Clipes

Retido

Criação de conteúdo de IA para gravações e vídeos

Usa transcrições de gravações de Evento para gerar conteúdo escrito e trechos de vídeo selecionados por IA a partir de momentos-chave da sessão.

Zoom Events

Retido

Recursos derivados de IA

Visão geral de como o Zoom processa recursos de geração de conteúdo de IA derivada

O diagrama acima ilustra como funcionalidades derivadas de IA opera utilizando conteúdo do usuário Disponível como contexto para tarefas e resultados assistidos por IA posteriores. Nesses casos, Zoom AI já não მუშაობa apenas com dados de interação ao vivo. Em vez disso, recorre a artefatos que já existem no ambiente de conteúdo mais amplo do usuário para responder a uma pergunta, sintetizar informações ou ajudar a produzir um novo resultado.

Dependendo da tarefa, este material contextual pode incluir artefatos como mensagens do chat, resumos de reunião, My Notes, transcrições, documentos do Zoom Canvas, apresentações (slide decks) do Zoom Slide, documentos do Zoom Paper, conteúdo do Zoom Mail ou do Zoom Calendar, dados de e-mail ou de calendário de terceiros conectados, ou arquivos enviados pelo usuário para dar Suporte a uma solicitação específica. Dessa forma, o Zoom AI está usando artefatos do Zoom criados anteriormente, juntamente com dados pessoais integrados quando disponíveis, para ajudar a alcançar o resultado final solicitado por um usuário.

O diagrama também reflete que este processo pode, por si só, gerar novo conteúdo do usuário. Por exemplo, o Zoom AI pode usar materiais existentes para criar uma nova Planilha do Zoom, um documento do Zoom Canvas, uma apresentação de slides do Zoom ou um documento do Zoom Paper. Depois de criados, esses novos artefatos passam a fazer parte do repositório de conteúdo mais amplo do usuário e podem posteriormente ser usados novamente como contexto para futuras funções e fluxos de trabalho assistidos por IA. Isso cria uma progressão em camadas na qual o conteúdo anterior do usuário pode Suporte resultados posteriores, e esses resultados, por sua vez, podem se tornar novos artefatos contextuais ao longo do tempo.

Esse mesmo padrão também pode aparecer em outras superfícies do Zoom. Em ambientes como Zoom hub ou o painel de chat de IA, os usuários podem fazer perguntas em toda a plataforma ou interagir com documentos e materiais disponíveis por meio da suíte de produtividade de IA do Zoom. Nesses casos, o Zoom AI está novamente trabalhando a partir de artefatos existentes acessíveis ao usuário para fornecer recuperação, síntese, პასუხa a perguntas ou acompanhamento, mostrando como os recursos de IA derivados ampliam o valor do conteúdo anterior para novas tarefas e resultados.

Nota

Carregamentos de arquivos locais do usuário podem ser desativados.

Este diagrama se aplica aos seguintes recursos:

Recurso
Descrição
Produto(s)
Retenção de artefatos

Geração de conteúdo

A geração de conteúdo usa IA para criar, refinar, resumir e organizar documentos, apresentações, planilhas e outras saídas a partir de comandos em linguagem natural.

Canvas, Planilhas, Paper, Slides

Retido

painel de chat de IA

Assistência conversacional de IA para fazer perguntas, gerar conteúdo e trabalhar em todo o contexto Disponível do Zoom.

painel de chat de IA

Retido

Fazer perguntas

Respostas geradas por IA com base em documentos e materiais selecionados no Zoom hub.

hub

Retido

Funcionalidades Generativas e de Composição

Visão geral de como o Zoom processa solicitações de IA generativa e de composição

O diagrama acima ilustra como funcionalidades generativas e de composição operar dentro da plataforma Zoom AI. Ao contrário dos recursos de IA derivados, que dependem de conteúdo pré-existente do usuário para ajudar a alcançar uma tarefa ou resultado posterior, os recursos generativos e de composição são frequentemente impulsionados mais diretamente pela entrada imediata do usuário. Em muitos casos, esses recursos não dependem de artefatos Zoom retidos já armazenados em outro lugar no ambiente de conteúdo do usuário. Em vez disso, eles são alimentados principalmente por prompts diretos do usuário, consultas, arquivos carregados ou pelo conteúdo imediato na tela associado à experiência do produto Ativo.

Essa distinção é especialmente importante para funcionalidades que funcionam a partir do conteúdo visível no contexto atual do usuário, em vez de a partir de artefatos previamente indexados ou retidos. Por exemplo, quando um usuário resume uma thread de chat, resume um e-mail ou pede ao Zoom AI para redigir uma resposta a um e-mail, o conteúdo relevante é normalmente retirado do contexto ativo do cliente e empacotado em uma carga útil de solicitação para processamento pelo Zoom AI. Em outras palavras, o Zoom não está necessariamente recuperando esse conteúdo de um repositório separado no lado do servidor para realizar a tarefa. Em vez disso, as informações relevantes da thread ativa, do conjunto de mensagens ou de outro contexto visível da interface são convertidas em forma de texto e enviadas ao Zoom AI a partir do aplicativo Zoom Workplace, para que o serviço possa executar processamento de linguagem natural, sumarização ou geração.

O diagrama também inclui casos de uso generativos que dependem principalmente de instrução direta do usuário, em vez de material de origem textual. Por exemplo, quando um usuário solicita a geração de imagens, o usuário descreve o resultado desejado por meio de um prompt, e o modelo gera a imagem com base nessa descrição. Em alguns contextos de produto, como o Zoom Whiteboard, essa geração de imagens pode depender de provedores de modelos de IA de terceiros. Em outros contextos, o Zoom pode usar seus próprios modelos hospedados. Por exemplo, a geração de imagens do plano de fundo virtual do Zoom pode depender de um modelo hospedado no Zoom que usa embeddings e processamento relacionado para gerar saídas visuais, e o conteúdo resultante passa por controles de moderação antes de ser devolvido ao usuário.

Tomados em conjunto, o diagrama mostra que os recursos generativos e de composição muitas vezes dependem menos de artefatos retidos e mais da intenção imediata do usuário, do contexto Ativo do lado do cliente ou de materiais de apoio enviados. Dessa forma, eles representam outro modo importante de operação do Zoom AI: não apenas recuperar e raciocinar com base em conteúdo anterior, mas também gerar novos resultados diretamente a partir da solicitação atual do usuário e do contexto ao redor.

Este diagrama se aplica aos seguintes recursos:

Recurso
Descrição
Produto(s)
Retenção de artefatos

plano de fundo virtual

Usa IA para criar imagens personalizadas de plano de fundo virtual a partir de prompts do usuário para uso em sessões do Zoom.

Reuniões, Eventos, webinar

Retido (se salvo)

Geração de imagens

Usa IA para transformar desenhos no quadro de compartilhamento ou artefatos visuais brutos em saídas visuais mais refinadas, renderizadas ou estilizadas.

quadro de compartilhamento

Retido (se salvo)

Geração de imagens

Usa IA para criar imagens com a marca e outros ativos visuais para eventos, como cabeçalhos, imagens da sessão e materiais relacionados à expo.

Eventos

Retido (se salvo)

Geração de conteúdo

Usa IA para gerar conteúdo do quadro de compartilhamento na tela, como texto, notas adesivas, tabelas, mapas mentais e outros elementos visuais estruturados a partir de prompts do usuário.

quadro de compartilhamento

Retido (se salvo)

Geração de conteúdo

Usa IA para gerar conteúdo escrito do Evento, como descrições, detalhes da sessão, biografias de palestrantes e anúncios do saguão.

Eventos

Retido (se salvo)

redação de e-mail

Usa IA para redigir e refinar o conteúdo do e-mail, incluindo corpos das mensagens, linhas de assunto e respostas.

e-mail

Retido (se enviado)

redação de chat

Usa IA para redigir e revisar mensagens de chat com base nos prompts do usuário e no contexto de conversa Disponível.

chat

Retido (se enviado)

Resumo de e-mail

Usa IA para resumir o conteúdo principal de um e-mail ou thread de e-mail.

e-mail

Não retido

Mensagem, Thread, Resumo de documento

Usa IA para resumir mensagens de chat, threads de conversa e documentos anexados compatíveis ou conteúdo Canvas vinculado.

chat

Não retido

Upload inteligente

Extrai detalhes do evento de arquivos carregados para construir automaticamente sessões, palestrantes e perguntas personalizadas.

Zoom Events

Retido (se salvo)

Minhas Notas

Minhas Notas no Zoom Meetings

Visão geral dos fluxos de dados do My Notes em Zoom Meetings

O diagrama acima mostra como, dentro do Zoom Meetings, o My Notes usa o caminho de áudio existente da reunião em vez de depender de outro áudio presente no Dispositivo do usuário. Quando o My Notes é ativado durante uma reunião no Zoom Meetings, ele acessa o áudio da reunião compartilhado roteado pela sessão de Multi-Media Router (MMR) da reunião. Esse áudio é então processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao Dispositivo do usuário e pode depois dar suporte à geração de notas pós-reunião.

Neste fluxo, a transcrição baseia-se especificamente no áudio da reunião do Zoom associado a essa sessão da reunião. Ela não se baseia em áudio local irrelevante do Dispositivo fora da própria reunião. Após o término da reunião, a transcrição e as notas resultantes podem permanecer Disponível de acordo com as Configurações de retenção aplicáveis do usuário, enquanto o áudio subjacente usado para a transcrição não é retido após a conclusão do processamento.

My Notes fora do Zoom Meetings

Visão geral dos fluxos de dados do My Notes fora do Zoom Meetings

O diagrama acima mostra como, fora do Zoom Meetings, o My Notes opera por meio do áudio do dispositivo local do usuário em vez de por meio de uma sessão compartilhada do Zoom. Se ativado durante uma reunião de terceiros ou uma discussão presencial, o My Notes pode usar acesso em nível do sistema ao microfone do usuário e, quando aplicável, ao áudio do sistema para capturar o áudio do dispositivo disponível nesse Dispositivo. Esse áudio é então roteado por meio de uma sessão MMR de usuário único e processado pelo serviço de Reconhecimento Automático de Fala (ASR) do Zoom para gerar uma transcrição, que é entregue ao Dispositivo do usuário e pode depois dar suporte à geração de notas pós-reunião.

Isso significa que, fora do Zoom Meetings, a transcrição baseia-se exclusivamente no áudio transmitido a partir do Dispositivo local do usuário, e não de um fluxo compartilhado de áudio da reunião do Zoom. O My Notes também pode solicitar que o usuário inicie uma nova nota quando a atividade do microfone do Dispositivo é detectada, ajudando a destacar os Recursos em situações como reuniões de terceiros, gravações baseadas no navegador ou outros fluxos de trabalho com microfone ativo. Assim como no fluxo durante a reunião, o áudio usado para a transcrição não é retido após a conclusão da transcrição, enquanto as notas e transcrições resultantes podem permanecer salvas na conta do usuário de acordo com as Configurações de retenção aplicáveis.

ZoomMate

Visão geral dos fluxos de dados do ZoomMate

O diagrama acima ilustra como ZoomMate funciona como uma superfície de trabalho principal no Zoom Workplace, operando no ponto em que o contexto do usuário, o conhecimento conectado e as capacidades de execução se unem. Em vez de existir apenas como um assistente independente, o ZoomMate fica no centro de um ambiente de trabalho mais amplo no qual os usuários podem pesquisar, raciocinar, criar e agir sobre os materiais e sistemas que apoiam seu trabalho diário.

Uma parte importante dessa Função decorre do Acessar do ZoomMate a conteúdo de primeira parte do Zoom. Isso pode incluir artefatos como resumos, My Notes, gravações, documentos do Canvas, mensagens de chat e outros materiais gerados pelo usuário criados na plataforma Zoom. Esses artefatos ajudam a fornecer ao ZoomMate o contexto de que ele precisa para responder perguntas, sintetizar informações, gerar resultados e apoiar o acompanhamento. O ZoomMate também pode usar memória, permitindo que ele incorpore preferências relevantes do usuário ou detalhes relacionados ao trabalho ao ajudar a concluir uma tarefa.

O diagrama também mostra como o ZoomMate vai além do conteúdo nativo do Zoom ao se integrar com fontes de conhecimento de terceiros. Por exemplo, serviços conectados de Armazenamento em nuvem, como Google Drive ou OneDrive, podem servir como repositórios externos de informações acessíveis ao usuário. Quando essas fontes são integradas, o Zoom pode indexar conteúdo aprovado para dar suporte à recuperação desses materiais, permitindo que o ZoomMate use busca agentiva para atuar tanto no conteúdo do Zoom quanto no conhecimento conectado de terceiros. Dessa forma, o ZoomMate pode pesquisar não apenas o que existe dentro do Zoom, mas também os documentos e materiais aos quais um usuário está autorizado a acessar em plataformas externas conectadas.

Outras fontes de dados pessoais, como e-mail e calendário (excluindo e-mails criptografados de ponta a ponta), também podem dar suporte ao ZoomMate, mas funcionam de maneira diferente. Em vez de serem indexadas, essas fontes geralmente se comunicam com o ZoomMate por meio de recuperação direta baseada em API. Isso as torna úteis para tarefas como localizar contexto relevante do e-mail, revisar informações do calendário ou ajudar a Agendar eventos, sem tratá-las como parte da camada de recuperação indexada usada para uma pesquisa mais ampla de documentos.

O diagrama também mostra que o ZoomMate pode se conectar a uma gama mais ampla de serviços e conectores de terceiros que dão suporte à execução de ações, bem como ao acesso a conhecimento. Isso pode incluir sistemas como Jira, HubSpot, ServiceNow, Workday e outras plataformas corporativas conectadas. Por meio dessas conexões, o ZoomMate pode executar tarefas agentivas em nome do usuário, como criar ou atualizar registros, recuperar informações de serviços externos ou executar outras ações conectadas nesses sistemas. Isso faz do ZoomMate mais do que uma superfície de recuperação e síntese; ele também funciona como uma camada de execução que pode ajudar a transformar contexto em ação.

Essa mesma base também ajuda a impulsionar agentes e fluxos de trabalho dentro do ambiente do ZoomMate. Os agentes podem usar o mesmo contexto subjacente, caminhos de recuperação e sistemas conectados para fornecer uma assistência mais dinâmica, baseada em raciocínio, ajudando os usuários a realizar tarefas mais amplas de várias etapas com maior continuidade e adaptabilidade. Os fluxos de trabalho, em contrapartida, podem oferecer uma automação mais estruturada e repetível, permitindo que os usuários definam processos recorrentes que operam em conteúdos do Zoom e, quando houver Suporte, em sistemas externos conectados. Dessa forma, o ZoomMate serve não apenas como uma interface conversacional, mas também como um ponto de orquestração tanto para atividade agentiva dinâmica quanto para automação mais estruturada.

Sandbox também pode dar Suporte a algumas das capacidades de execução mais avançadas do ZoomMate. Para tarefas que exigem execução de código, geração de arquivos, automação ou outro processamento mais sofisticado, o ZoomMate pode usar um ambiente sandbox separado, em vez de depender apenas do processamento conversacional padrão. Essa sandbox é executada na infraestrutura AWS da Zoom e fornece uma camada de execução isolada e de curta duração para tarefas de maior complexidade, ajudando o ZoomMate a realizar determinadas operações em um ambiente mais controlado. Dessa forma, a mesma base mais ampla do ZoomMate que dá Suporte à recuperação, ao raciocínio, aos agentes e aos fluxos de trabalho também pode dar Suporte à execução de tarefas mais avançadas quando o trabalho solicitado exigir isso.

Por fim, o diagrama não representa todos os componentes subjacentes que ajudam a dar Suporte ao ZoomMate. Ele não foi feito para Mostrar explicitamente camadas de capacidade fundamentais, como skills, ou outras estruturas de Suporte que fazem parte da infraestrutura e do design mais amplos do Zoom AI. Presume-se que esses elementos operem dentro do sistema de IA subjacente que permite o comportamento do ZoomMate. O objetivo deste diagrama é, em vez disso, Mostrar os principais contextos, conhecimentos e superfícies de ação por meio dos quais o ZoomMate funciona como uma superfície de trabalho unificada em todo o Zoom e em sistemas conectados.

Conexões e Indexação de Terceiros do ZoomMate

Visão geral de como o ZoomMate se conecta a conexões de terceiros e fontes de dados

O diagrama acima ilustra duas partes relacionadas, mas distintas, da arquitetura de dados de terceiros do ZoomMate. A primeira é como o ZoomMate se conecta a aplicativos e serviços de terceiros suportados para que possa recuperar informações ou tomar ações dentro desses sistemas. A segunda é como certas fontes de conteúdo de terceiros suportadas podem ser ingeridas e indexadas para que o ZoomMate possa depois recuperar esse conteúdo de forma mais eficiente por meio de geração aumentada por recuperação.

O ZoomMate pode conectar-se diretamente a aplicativos e serviços de terceiros

Uma parte do diagrama mostra como o ZoomMate se conecta a aplicativos de terceiros suportados, como Jira, Confluence, Salesforce, ServiceNow, Workday, plataformas de Armazenamento em nuvem e outros sistemas empresariais externos. Essas conexões permitem que o ZoomMate opere além do conteúdo nativo do Zoom, interagindo com ferramentas que armazenam dados empresariais ou dão suporte ao trabalho operacional fora da plataforma Zoom.

Essas conexões são estabelecidas por meio de uma conexão TLS através de modelos de acesso autorizados, como integrações baseadas em API ou conexões baseadas em MCP. Em qualquer caso, o ZoomMate opera dentro das Permissões concedidas pelo serviço conectado. Isso permite que o ZoomMate recupere informações relevantes desses sistemas e, quando suportado, tome ações neles em nome do usuário. Por exemplo, o ZoomMate pode recuperar detalhes de um issue do Jira, pesquisar uma página do Confluence, atualizar um registro no ServiceNow ou usar outro sistema conectado como parte da execução de uma tarefa mais ampla.

Esse modelo de conexão direta é especialmente importante para tarefas que dependem do estado atual do sistema ou de acesso ao vivo a ferramentas de terceiros. Nesses casos, o ZoomMate pode usar o aplicativo conectado como um ponto de extremidade de serviço Ativo, em vez de apenas como um repositório de conteúdo previamente indexado.

O ZoomMate pode indexar conteúdo de terceiros aprovado para recuperação posterior

Uma segunda parte do diagrama mostra como o ZoomMate pode ingerir e indexar conteúdo de fontes de terceiros suportadas para que o material possa ser recuperado posteriormente como parte de uma pesquisa ou de uma resposta assistida por IA. Esse modelo de recuperação indexada é mais relevante para repositórios de conteúdo conectados, como sistemas de Armazenamento em nuvem, bases de conhecimento, plataformas de documentos e outras fontes suportadas nas quais o ZoomMate pode precisar pesquisar um volume maior de conteúdo externo retido.

Depois que uma fonte suportada é conectada e aprovada para indexação, o ZoomMate pode recuperar conteúdo dessa fonte e prepará-lo para pesquisa posterior. Esse processo de preparação pode incluir a divisão de arquivos ou registros maiores em unidades menores e a adição de metadados como origem, hora de atualização, propriedade e informações de Permissão. Em seguida, esse conteúdo é gravado na camada de indexação do Zoom para que possa ser pesquisado posteriormente tanto por correspondência exata quanto por recuperação baseada em significado.

Quando um usuário envia uma solicitação que depende de conteúdo de terceiros indexado, o ZoomMate pode pesquisar esse material indexado, avaliar quais resultados são mais relevantes e aplicar as informações de Permissão associadas à fonte original para que apenas conteúdo autorizado seja elegível para aparecer. O conteúdo autorizado mais relevante pode então ser passado para a camada de IA do ZoomMate como contexto de apoio para a resposta. Dessa forma, o diagrama mostra como o conteúdo de terceiros indexado pode ajudar o ZoomMate a produzir respostas fundamentadas em materiais empresariais conectados reais, em vez de depender apenas do conhecimento geral do modelo.

Avatares personalizados

Criação de avatar

Visão geral do processo de criação de Avatar Personalizado

O diagrama acima ilustra como um avatar personalizado é criado a partir do vídeo e da voz gravados de um usuário. O processo começa quando o usuário recebe um roteiro e é solicitado a gravar-se lendo-o. Esta etapa de gravação guiada permite à Zoom capturar o material audiovisual necessário para gerar tanto a semelhança do avatar do usuário quanto o modelo de voz associado usado em saídas posteriores baseadas em avatar.

Após o usuário concluir a gravação, os componentes de áudio e vídeo são processados por caminhos diferentes. O áudio é enviado a um serviço terceirizado que gera uma semelhança de voz com base na fala gravada do usuário. Assim que esse processamento é concluído, o serviço terceirizado retorna à Zoom um identificador de voz exclusivo. A Zoom armazena esse identificador como a referência de voz do usuário para que ele possa ser usado posteriormente ao gerar clipes baseados em avatar ou outras saídas compatíveis que dependem dessa voz sintetizada.

Ao mesmo tempo, o componente de vídeo é enviado a um módulo de geração de avatar hospedado pela Zoom, onde a Zoom processa o material visual gravado para criar a representação de avatar do usuário. Isso resulta em um modelo de avatar que a Zoom armazena para uso futuro. Considerados em conjunto, esses dois resultados retidos — o identificador de voz armazenado e o modelo de avatar armazenado — servem para Permitir que a Zoom gere futuros clipes ou mídia baseada em avatar que reflitam tanto a semelhança do usuário quanto sua voz sintetizada.

Criação de clipe

Visão geral do processo de criação de clipe do Avatar Personalizado

O diagrama acima ilustra como um clipe de avatar personalizado é criado a partir do avatar armazenado e do perfil de voz sintetizada de um usuário. O processo começa quando o usuário envia o roteiro que quer apresentar por meio do avatar. Esse roteiro serve como o conteúdo de origem para o clipe gerado. A partir daí, o backend web da Zoom coordena duas entradas paralelas necessárias para criar o resultado final. Primeiro, ele envia o identificador de voz armazenado do usuário juntamente com o roteiro ao serviço terceirizado de geração de voz, que produz o áudio do clipe usando a voz sintetizada do usuário. Segundo, ele envia o modelo de avatar armazenado do usuário ao módulo de geração de avatar da Zoom para que o componente visual do clipe possa ser preparado usando a semelhança do avatar previamente criada do usuário. Assim que o serviço terceirizado de geração de voz produz o áudio, esse áudio é devolvido à Zoom e passado para o módulo de geração de avatar. O módulo de geração de avatar então combina o modelo de avatar armazenado com o áudio de voz gerado, sincronizando os movimentos faciais e da boca do avatar com o conteúdo falado. Após a conclusão desse processo de sincronização labial e renderização, a Zoom produz o clipe de avatar finalizado e o entrega de volta ao usuário.

Dicionário personalizado

Fluxos de dados do dicionário personalizado

O diagrama acima ilustra como a funcionalidade (Recursos) de Dicionário Personalizado ajuda a melhorar a precisão das saídas do Zoom baseadas em fala, fornecendo ao serviço de Reconhecimento Automático de Fala (ASR) do Zoom um contexto adicional de vocabulário. Esta funcionalidade foi projetada para dar suporte a palavras, abreviações, jargões, nomes de produtos ou terminologia especializada que podem ser específicos de uma empresa, setor, equipe ou região e que, de outra forma, poderiam não ser reconhecidos ou representados corretamente durante a transcrição.

O processo começa quando um administrador da conta cria e armazena um dicionário personalizado no Portal web do Zoom. Esse dicionário contém a lista de palavras ou frases aprovadas que a Organização deseja que o Zoom reconheça com mais precisão. Depois que o dicionário é salvo no nível da conta, ele se torna Disponível para uso em contextos suportados de reunião e de processamento de fala.

Quando um usuário inicia posteriormente uma reunião, o serviço AASR do Zoom pode receber o dicionário personalizado da conta como parte do seu contexto de processamento. À medida que o serviço ASR converte áudio ao vivo em dados de fala para texto, ele pode comparar a linguagem falada percebida com o dicionário personalizado e tentar mapear os sons reconhecidos aos termos armazenados. Isso fornece ao ASR orientação adicional sobre quais palavras procurar, como certos termos podem ser soletrados e como abreviações ou linguagem especializada devem ser interpretadas.

O resultado é que a saída inicial de fala para texto pode refletir com mais precisão a terminologia realmente usada na reunião. Essa precisão aprimorada pode então ser levada adiante para artefatos posteriores derivados da conversa. Por exemplo, se um resumo da reunião, legendas, transcrição ou outro ativo baseado em dados de fala para texto for gerado posteriormente, essas saídas podem refletir uma representação mais precisa das palavras faladas durante a reunião, ajudando a melhorar a qualidade e a utilidade do artefato gerado por IA resultante.

Modelos personalizados de resumo da reunião

Fluxos de dados dos Modelos personalizados de resumo da reunião

O diagrama acima ilustra como os resumos personalizados da reunião são gerados a partir de um modelo definido pelo usuário ou pela conta. O processo começa quando um modelo é criado e salvo no Zoom. No nível da conta, um administrador pode definir um modelo personalizado de resumo da reunião para uso organizacional. No nível individual, um usuário pode criar um modelo pessoal de resumo da reunião com base em suas próprias preferências. Uma vez criado, o modelo selecionado é armazenado para que possa ser aplicado durante a geração posterior do resumo.

À medida que uma reunião termina, o Zoom AI pode usar os dados de fala para texto da reunião para gerar um resumo que siga a estrutura e a ênfase do modelo personalizado escolhido. Se o modelo personalizado foi selecionado antes de o resumo da reunião ser gerado, o Zoom AI aplica esse modelo diretamente ao produzir o resumo. Isso permite que a saída resultante reflita o formato específico, as seções ou as prioridades definidas no modelo, em vez de apenas uma estrutura de resumo padrão.

Se um modelo personalizado não foi selecionado antes de o resumo ser gerado pela primeira vez, o Zoom só pode aplicar esse modelo mais tarde se a transcrição da reunião tiver sido retida. Nesse caso, o Zoom AI pode reprocessar a transcrição retida usando a configuração do modelo e produzir um novo resumo alinhado a essa estrutura. Se a transcrição não tiver sido retida, no entanto, o Zoom não tem a transcrição subjacente disponível para reprocessamento, o que significa que o modelo personalizado não pode ser aplicado posteriormente.

Isolamento pessoal de áudio

Visão geral de como o Isolamento Pessoal de áudio isola a voz de um usuário

O diagrama acima ilustra como Isolamento pessoal de áudio funciona usando um molde de voz armazenado localmente no Dispositivo do usuário para distinguir a fala do usuário do Ruído de fundo ao redor. O processo começa quando o usuário grava um exemplo de áudio por meio dos Recursos de Personal Audio Isolation no Zoom Workplace aplicativo. Essa gravação é usada para criar um molde de voz local que ajuda o aplicativo a reconhecer as características da voz do usuário. Esse molde de voz permanece na máquina local e não é transmitido para a Zoom cloud.

Quando o usuário fala mais tarde durante uma reunião em um ambiente com ruído ambiente, o aplicativo Zoom Workplace usa essa impressão vocal armazenada localmente para ajudar a identificar os padrões de fala do usuário e separá-los dos sons ao redor. Isso permite ao aplicativo: Reduzir ruído de fundo e isolar a voz do usuário de forma mais eficaz antes de o áudio ser enviado adiante pelo fluxo da reunião.

Como resultado, o áudio transmitido para a Zoom cloud é o áudio de reunião refinado, com ruído ambiente filtrado na medida suportada pelos Recursos. A própria marca de voz subjacente do usuário não é enviada para a infraestrutura de nuvem da Zoom. Dessa forma, o Personal Audio Isolation opera como um processamento local em nível de Dispositivo que melhora a clareza do áudio antes de o áudio limpo ser transmitido para a sessão Zoom ao vivo.

Última atualização

Isto foi útil?