Diagramas y flujos de datos
Diagramas y flujos de datos de Zoom AI para Zoom Workplace, Webinars y eventos
Las capacidades de IA de Zoom abarcan una amplia gama de productos, servicios y flujos de trabajo, lo que significa que ningún diagrama único puede capturar de manera razonable o completa cómo funciona la IA en toda la plataforma de Zoom. Las distintas características dependen de diferentes entradas, rutas de procesamiento, comportamientos de almacenamiento, interacciones entre modelos y resultados. Algunas operan solo con datos en vivo y efímeros durante una interacción activa, mientras que otras crean artefactos retenidos que más adelante pueden dar soporte a características adicionales. Algunas funciones permanecen por completo dentro del entorno de primera parte de Zoom, mientras que otras dependen de la arquitectura de IA federada de Zoom y, en algunos casos, de sistemas externos conectados. Para que este sistema dinámico y expansivo sea más fácil de entender, esta página presenta una serie de diagramas en lugar de basarse en un único modelo visual. Cada uno resalta una capa, una ruta o un patrón de características diferente dentro de la plataforma más amplia de Zoom AI. Al final de estas secciones hay tablas que detallan qué características son aplicables, su producto asociado y su estado de retención de artefactos. Más adelante, otras secciones examinan individualmente ciertas características de producto a medida, ofreciendo explicaciones más centradas sobre cómo funcionan esas capacidades específicas.
La secuencia comienza a continuación con una vista general simplificada de Zoom AI en su forma más básica, mostrando la plataforma en un estado centrado en la primera parte que utiliza la arquitectura estándar de modelo federado de Zoom, pero que todavía no introduce integraciones empresariales de terceros ni fuentes externas de datos de clientes más allá de los proveedores de modelos de IA de terceros de Zoom. A partir de ahí, los diagramas introducen gradualmente partes más especializadas de la plataforma, incluidas las opciones de enfoque de IA de Zoom, la transformación del audio en vivo en artefactos utilizables por IA y las formas en que esos artefactos pueden luego dar soporte a otras características y flujos de trabajo. En conjunto, estos diagramas están pensados para hacer que un sistema muy complejo sea más accesible, desglosándolo en vistas más pequeñas y fáciles de seguir que reflejan cómo funcionan en la práctica las distintas partes de la plataforma de Zoom AI.
Zoom AI

El diagrama anterior presenta la plataforma de IA de Zoom de forma simplificada, mostrando la plataforma en uno de sus estados más fundamentales. Ilustra cómo diferentes partes de la arquitectura más amplia de productos y servicios de Zoom, conocida como el backend web de Zoom, incluidas áreas como Reuniones, Phone, Centro de contacto, reconocimiento automático del habla y otras ofertas de Zoom, se integran en la plataforma más amplia de Zoom y contribuyen al conjunto de contenido accesible para el usuario que puede dar soporte a la funcionalidad de IA posterior.
Un concepto central en este diagrama es contenido del usuario de Zoom. Esto se refiere al contenido generado a través de las interacciones de un usuario con los productos y servicios de Zoom que más adelante puede servir como entrada, contexto o artefactos para experiencias impulsadas por IA. Según el producto y la característica implicados, esto puede incluir materiales como mensajes de Zoom Chat, resúmenes de reuniones, transcripciones, documentos de Canvas, My Notes, grabaciones y otros artefactos similares orientados al usuario. Estos materiales constituyen una parte importante de la capa contextual que puede dar soporte posteriormente a la recuperación, el razonamiento, la resumición y el seguimiento asistidos por IA.
Parte de este contenido también puede prepararse para un uso futuro de IA mediante infraestructura de recuperación, como la recuperación indexada o módulos de generación aumentada por recuperación. En esos casos, los artefactos relevantes pueden ingerirse e indexarse para que puedan localizarse y utilizarse con más eficiencia en consultas o procesos de IA posteriores. Esto ayuda a que Zoom AI funcione no solo con interacciones en vivo, sino también con contexto retenido y materiales anteriores generados por usuarios en toda la plataforma.
Por último, el diagrama también presenta Zoom AI a Zoom AI como la capa compartida de IA que opera en todo este ecosistema más amplio. En esta vista simplificada, Zoom AI se muestra mediante el enfoque federado estándar de Zoom, en el que Zoom puede usar tanto modelos alojados en Zoom que se ejecutan dentro de la propia infraestructura de Zoom como proveedores seleccionados de modelos de IA de terceros cuando sea apropiado para la tarea en cuestión. Este modelo federado permite a Zoom enrutar las tareas de IA hacia el entorno de modelo disponible más adecuado, al tiempo que mantiene una experiencia de IA unificada en toda la plataforma.
Enfoques del modelo de servicio de Zoom AI

El diagrama anterior ilustra los tres enfoques de IA de Zoom: el enfoque federado, Modelos alojados en Zoom Plus (ZM+) y Solo modelos alojados en Zoom (ZMO). En conjunto, estos representan las tres formas principales en que Zoom ofrece servicios de IA a los Clientes, y cada una proporciona un equilibrio distinto entre amplitud de características, flexibilidad del modelo y control de datos.
El enfoque federado es el enfoque estándar de Zoom y el más completo en cuanto a características. Permite a Zoom trabajar con varios proveedores de IA, incluidos modelos alojados en Zoom y socios de modelos de terceros seleccionados, de modo que las tareas puedan enrutarse al modelo más adecuado para la solicitud. ZM+ ofrece un modelo de despliegue más controlado mediante el uso de instancias de modelo dedicadas administradas por Zoom, mientras que Solo modelos alojados en Zoom (ZMO) mantiene el procesamiento de IA únicamente dentro de modelos alojados en Zoom, ofreciendo la ruta de modelo más restrictiva y controlada, pero con un conjunto de características más limitado.
Para los fines de esta página, los diagramas que siguen generalmente ilustran el enfoque federado, ya que refleja el enfoque estándar de Zoom y la visión más amplia de la funcionalidad de Zoom AI. Las organizaciones que usan ZM+ o ZMO a menudo pueden interpretar estos mismos diagramas eliminando mentalmente a los proveedores de modelos de IA de terceros y centrándose en las partes restantes del flujo administradas por Zoom.
Consulte la página Zoom AI Models, Processing, Storage, and Usage para obtener más información.
Características y artefactos de medios en vivo

El diagrama anterior ilustra cómo las interacciones de medios en vivo, como las reuniones y las llamadas telefónicas, pueden producir características y artefactos impulsados por IA posteriores en toda la plataforma de Zoom. En cada caso, el audio en vivo entra en Zoom a través del punto de conexión asociado con ese producto o servicio. Para las reuniones, por lo general, este es el Multimedia Router (MMR). Para la telefonía, el audio suele entrar a través de zonas SIP.
Una vez ingerido el audio, se enruta al Reconocimiento automático del habla (ASR) servicio, que convierte el audio en vivo en datos de voz a texto. Esos datos de voz a texto pueden utilizarse de varias maneras según la Configuración y las Características habilitadas. En algunos casos, se entregan inmediatamente a los usuarios como subtítulos en vivo. En los contextos compatibles, también puede enviarse al Traducción en vivo servicio, que traduce la salida de voz a texto en subtítulos traducidos para Participantes en otros idiomas.
Los datos de voz a texto también pueden dar soporte a características más persistentes o derivadas. Si la transcripción está habilitada, o si un usuario está usando My Notes, el servicio ASR puede producir una transcripción después de que concluya la sesión en vivo. Sin embargo, si la retención de la transcripción no está habilitada, los datos de voz a texto utilizados durante la interacción no se retienen como una transcripción persistente. Incluso en esos casos, Zoom AI aún puede usar los datos de voz a texto de forma efímera durante la sesión para dar soporte a características de IA en vivo. transcripción está habilitada, o si un usuario está usando My Notes, el servicio ASR puede producir una transcripción después de que concluya la sesión en vivo. Sin embargo, si la retención de la transcripción no está habilitada, los datos de voz a texto utilizados durante la interacción no se retienen como una transcripción persistente. Incluso en esos casos, Zoom AI aún puede usar los datos de voz a texto de forma efímera durante la sesión para dar soporte a características de IA en vivo.
Por ejemplo, un usuario puede hacer preguntas durante la reunión a través de Zoom AI durante una reunión. En ese caso, Zoom AI puede usar los datos de voz a texto en vivo de la reunión para interpretar la pregunta del usuario y generar una respuesta relevante basada en la conversación en curso.
Una distinción clave en este flujo es que Zoom AI no necesariamente conserva una transcripción de la conversación simplemente porque se hayan usado datos de voz a texto durante la sesión. A menos que la retención de la transcripción esté habilitada específicamente, o que los datos se estén reteniendo a través de una característica tal como My Notesdocumento de Zoom Canvas, los propios datos de voz a texto pueden seguir siendo efímeros. Al mismo tiempo, algunos artefactos posteriores producidos a partir de esos datos pueden persistir. Por ejemplo, si un usuario hace preguntas durante una reunión, la conversación de IA resultante o las notas relacionadas pueden seguir disponibles posteriormente como un artefacto retenido, incluso cuando no se produce una transcripción persistente.
Algunos artefactos retenidos también pueden convertirse en la base para artefactos y flujos de trabajo posteriores adicionales. Un resumen de la reunión, un resumen del seminario web, un resumen de la llamada o las My Notes de un usuario pueden convertirse en un documento de Zoom Canvas, donde puede seguir editándose, ampliándose y usándose como un artefacto de trabajo. A su vez, esos documentos resultantes pueden luego servir como contexto para otras características o flujos de trabajo de IA analizados en otra parte de este documento. De este modo, el audio en vivo puede dar lugar no solo a características de IA inmediatas, sino también a una cadena de artefactos retenidos que siguen dando soporte al trabajo asistido por IA posterior en toda la plataforma de Zoom. Zoom Canvas documento, donde puede seguir editándose, ampliándose y usándose como un artefacto de trabajo. A su vez, esos documentos resultantes pueden luego servir como contexto para otras características o flujos de trabajo de IA analizados en otra parte de este documento. De este modo, el audio en vivo puede dar lugar no solo a características de IA inmediatas, sino también a una cadena de artefactos retenidos que siguen dando soporte al trabajo asistido por IA posterior en toda la plataforma de Zoom.
Este diagrama es aplicable a las siguientes características:
Subtítulos en vivo
Subtítulos de voz a texto en tiempo real para sesiones en vivo.
Reuniones, seminarios web
No retenido
subtítulos traducidos
subtítulos traducidos en tiempo real generados a partir de datos de voz a texto en vivo.
Reuniones, seminarios web
No retenido
transcripciones
Registros de texto retenidos del contenido de voz a texto de la reunión.
Reuniones, telefonía
Retenido
resumen de la reunión
Resumen generado por IA de los puntos clave de discusión de la reunión, las decisiones y los elementos de acción.
Reuniones
Retenido
Resumen del seminario web
Resumen generado por IA del contenido clave del seminario web compartido después de la sesión.
seminarios web
Retenido
Resumen de la llamada
Resumen posterior a la llamada generado por IA de los detalles clave y los elementos de acción.
Teléfono
Retenido
My Notes
Notas personales, transcripción y contexto de la reunión retenidos para consulta y seguimiento posteriores.
Reuniones
Retenido
Tareas de seguimiento
Acciones de seguimiento sugeridas por IA basadas en los detalles de la conversación.
Zoom Tasks
Retenido
Priorización del correo de voz
Clasificación basada en IA de los mensajes de voz según la importancia definida por el usuario.
Teléfono
Retenido
Preguntas de la reunión
Respuestas de IA a las preguntas de la reunión usando el contexto de la reunión en vivo.
Reuniones
Retenido
Preguntas del seminario web
Respuestas de IA a las preguntas del seminario web usando el contexto del seminario web en vivo.
seminarios web
Retenido
Preguntas de la llamada
Respuestas de IA a las preguntas de la llamada usando el contexto de la llamada en vivo.
Teléfono
Retenido
Funciones de grabación

El diagrama anterior ilustra cómo Zoom AI admite funciones de IA basadas en grabaciones al operar sobre la grabación completa después de que la sesión en vivo haya terminado. Al igual que con otras experiencias de Zoom basadas en audio, el medio original ingresa a través de la infraestructura asociada con el producto en uso, como la MMR para reuniones o la zona SIP correspondiente. Como parte de ese flujo, la grabación se crea y se envía al servicio de grabación de Zoom, donde luego la grabación completada se almacena en el almacenamiento de contenido de Zoom.
Una vez finalizada la grabación, el audio asociado con esa grabación se envía al servicio de Zoom para la transcripción. Este proceso produce una Reconocimiento automático del habla (ASR) transcripción específica de la grabación, que puede diferir de los datos de voz a texto generados durante la propia sesión en vivo. En otras palabras, la transcripción asociada con una grabación completada se genera como parte del flujo de procesamiento posterior a la grabación, en lugar de copiarse simplemente desde la capa de interacción en vivo.
Después de producirse la transcripción de la grabación, esta puede enviarse a Zoom AI Zoom AI para un análisis adicional. En esta etapa, Zoom AI procesa la transcripción para identificar artefactos de grabación de nivel superior, como resúmenes, resaltados, capítulos y otras representaciones estructuradas de la conversación. Este análisis se realiza utilizando la capa de procesamiento de IA de Zoom, incluidos los modelos alojados por Zoom cuando corresponda, para transformar la transcripción sin procesar de la grabación en resultados posteriores a la reunión o posteriores a la llamada más utilizables.
Una vez completado ese análisis, los artefactos generados por IA resultantes se asocian con la propia grabación. Esto permite a los usuarios que visualizan una grabación ver no solo la grabación y la transcripción, sino también las capas adicionales generadas por IA que hacen que el contenido sea más fácil de navegar y comprender. De esta manera, el diagrama muestra cómo una grabación completada puede convertirse en la base de una segunda etapa de procesamiento de IA, produciendo funciones de grabación enriquecidas que se extienden más allá del medio almacenado original.
Este diagrama es aplicable a las siguientes características:
Grabación inteligente
resaltados, capítulos y resúmenes generados por IA para reuniones grabadas
Reuniones
Retenido
Generar títulos, descripciones y etiquetas
Títulos, descripciones y etiquetas generados por IA para clips.
Clips
Retenido
Creación de contenido con IA para grabaciones y videos
Usa las transcripciones de grabaciones de eventos para generar contenido escrito y fragmentos de video seleccionados por IA a partir de momentos clave de la sesión.
Zoom Events
Retenido
Funciones de IA derivadas

El diagrama anterior ilustra cómo funciones derivadas de IA operar utilizando contenido disponible del usuario como contexto para tareas posteriores asistidas por IA y resultados. En estos casos, Zoom AI ya no trabaja solo a partir de datos de interacción en vivo. En cambio, se basa en artefactos que ya existen dentro del entorno de contenido más amplio del usuario para responder una pregunta, sintetizar información o ayudar a producir un nuevo resultado.
Dependiendo de la tarea, este material contextual puede incluir elementos como mensajes de chat, resúmenes de la reunión, My Notes, transcripciones, documentos de Zoom Canvas, presentaciones tipo Zoom Slide decks, documentos de Zoom Paper, contenido de Zoom Mail o de Zoom Calendar, datos de correo electrónico o de calendario de terceros conectados, o archivos cargados por el usuario para respaldar una solicitud en particular. De esta forma, Zoom AI utiliza artefactos de Zoom creados previamente, junto con datos a nivel personal integrados cuando estén disponibles, para ayudar a lograr el fin solicitado por el usuario.
El diagrama también refleja que este proceso en sí mismo puede generar contenido de nuevo usuario. Por ejemplo, Zoom AI puede usar materiales existentes para crear un nuevo Zoom Sheet, documento Zoom Canvas, Zoom Slide deck o documento Zoom Paper. Una vez creados, esos nuevos artefactos pasan a formar parte del repositorio de contenido más amplio del usuario y pueden volver a usarse más adelante como contexto para futuras funciones y flujos de trabajo asistidos por IA. Esto crea una progresión por capas en la que el contenido anterior del usuario puede servir de apoyo a resultados posteriores, y esos resultados, a su vez, pueden convertirse con el tiempo en nuevos artefactos contextuales.
Este mismo patrón también puede aparecer en otras superficies de Zoom. En entornos como Zoom hub o el panel de chat de IA, los usuarios pueden hacer preguntas en toda la plataforma o interactuar con documentos y materiales Disponible a través de la suite de productividad de IA de Zoom. En esos casos, Zoom AI vuelve a trabajar a partir de artefactos existentes accesibles para el usuario para proporcionar recuperación, síntesis, respuesta a preguntas o seguimiento, mostrando cómo las funciones derivadas de IA amplían el valor del contenido previo en nuevas tareas y resultados.
Nota
Cargas locales de archivos de usuario pueden deshabilitarse.
Este diagrama es aplicable a las siguientes características:
Generación de contenido
La generación de contenido usa IA para crear, refinar, resumir y organizar documentos, presentaciones, hojas de cálculo y otras salidas a partir de indicaciones en lenguaje natural.
Lienzo, Hojas, Papel, Diapositivas
Retenido
panel de chat de IA
Asistencia conversacional de IA para hacer preguntas, generar contenido y trabajar en el contexto Zoom Disponible.
panel de chat de IA
Retenido
Hacer preguntas
Respuestas generadas por IA basadas en documentos y materiales seleccionados en Zoom hub.
hub
Retenido
Características generativas y de composición

El diagrama anterior ilustra cómo funciones generativas y de composición operan dentro de la plataforma Zoom AI. A diferencia de las funciones de IA derivadas, que dependen de contenido preexistente del usuario para ayudar a lograr una tarea o resultado posterior, las funciones generativas y de composición a menudo están impulsadas más directamente por la entrada inmediata del usuario. En muchos casos, estas funciones no dependen de artefactos de Zoom retenidos que ya estén almacenados en otro lugar del entorno de contenido del usuario. En su lugar, se alimentan principalmente de indicaciones directas del usuario, consultas, archivos cargados o del contenido inmediato en pantalla asociado con la experiencia de producto activo.
Esta distinción es especialmente importante para las funciones que trabajan a partir del contenido visible en el contexto actual del usuario, en lugar de partir de artefactos previamente indexados o retenidos. Por ejemplo, cuando un usuario resume un hilo de chat, resume un correo electrónico o le pide a Zoom AI que redacte una respuesta a un correo electrónico, el contenido relevante normalmente se toma del contexto activo del cliente y se empaqueta en una carga útil de solicitud para el procesamiento de Zoom AI. En otras palabras, Zoom no necesariamente recupera ese contenido de un repositorio independiente del lado del servidor para realizar la tarea. En su lugar, la información relevante del hilo activo, del conjunto de mensajes o de otro contexto visible de la interfaz se convierte en texto y se envía a Zoom AI desde la aplicación Zoom Workplace para que el servicio pueda realizar procesamiento de lenguaje natural, resumen o generación.
El diagrama también incluye casos de uso generativos que dependen principalmente de instrucciones directas del usuario en lugar de material fuente textual. Por ejemplo, cuando un usuario solicita la generación de imágenes, el usuario describe el resultado deseado mediante un prompt y el modelo genera la imagen en función de esa descripción. En algunos contextos de producto, como Zoom Whiteboard, esta generación de imágenes puede depender de proveedores de modelos de IA de terceros. En otros contextos, Zoom puede usar sus propios modelos alojados. Por ejemplo, la generación de imágenes de fondo virtual de Zoom puede depender de un modelo alojado por Zoom que utiliza embeddings y un procesamiento relacionado para generar resultados visuales, y el contenido resultante pasa por controles de moderación antes de devolverse al usuario.
En conjunto, el diagrama muestra que las funciones generativas y de composición a menudo dependen menos de los artefactos conservados y más de la intención inmediata del usuario, del contexto activo del lado del cliente o de los materiales de apoyo cargados. De este modo, representan otro modo importante de funcionamiento de Zoom AI: no solo recuperar y razonar a través del contenido previo, sino también generar nuevos resultados directamente a partir de la solicitud actual del usuario y del contexto circundante.
Este diagrama es aplicable a las siguientes características:
fondo virtual
Utiliza IA para crear imágenes personalizadas de fondo virtual a partir de indicaciones del usuario para su uso en sesiones de Zoom.
Reuniones, Evento, seminario web
Conservado (si se guardó)
Generación de imágenes
Utiliza IA para transformar dibujos en la pizarra o artefactos visuales aproximados en resultados visuales más pulidos, renderizados o estilizados.
pizarra
Conservado (si se guardó)
Generación de imágenes
Utiliza IA para crear imágenes de marca y otros recursos visuales para el Evento, como encabezados, imágenes de la sesión y materiales relacionados con la expo.
Evento
Conservado (si se guardó)
Generación de contenido
Utiliza IA para generar contenido de pizarra en pantalla, como texto, notas adhesivas, tablas, mapas mentales y otros elementos visuales estructurados a partir de indicaciones del usuario.
pizarra
Conservado (si se guardó)
Generación de contenido
Utiliza IA para generar contenido escrito del Evento, como descripciones, detalles de la sesión, biografías de ponentes y anuncios del lobby.
Evento
Conservado (si se guardó)
redacción de correos electrónicos
Usa IA para redactar y refinar el contenido del correo electrónico, incluidos los cuerpos de los mensajes, las líneas de asunto y las respuestas.
correo electrónico
Retenido (si se envía)
chat Compose
Usa IA para redactar y revisar mensajes de chat basados en las indicaciones del usuario y el contexto de conversación Disponible.
Chat
Retenido (si se envía)
Resumen de correo electrónico
Usa IA para resumir el contenido clave de un correo electrónico o de un hilo de correo electrónico.
correo electrónico
No retenido
Resumen de mensaje, hilo y doc.
Usa IA para resumir mensajes de chat, hilos de conversación y documentos adjuntos compatibles o contenido enlazado de Canvas.
Chat
No retenido
Carga inteligente
Extrae detalles del Evento de los archivos cargados para crear automáticamente sesiones, ponentes y preguntas personalizadas.
Zoom Events
Conservado (si se guardó)
My Notes
Mis notas en Zoom Meetings

El diagrama anterior muestra cómo, dentro de Zoom Meetings, My Notes utiliza la ruta de audio existente de la reunión en lugar de depender de otro audio presentar en el Dispositivo del usuario. Cuando My Notes está habilitado durante una reunión de Zoom, accede al audio compartido de la reunión enrutado a través de la sesión Multi-Media Router (MMR) de la reunión. Luego, Zoom procesa ese audio mediante su servicio de Reconocimiento Automático del Habla (ASR) para generar una transcripción, que se entrega al Dispositivo del usuario y más tarde puede ayudar a generar notas posteriores a la reunión.
En este flujo, la transcripción se basa específicamente en el audio de la reunión de Zoom asociado con esa sesión de reunión. No se basa en audio del dispositivo local no relacionado fuera de la reunión en sí. Después de que concluya la reunión, la transcripción y las notas resultantes pueden permanecer Disponible según la Configuración de retención aplicable del usuario, mientras que el audio subyacente utilizado para la transcripción no se conserva después de que se complete el procesamiento.
Mis notas fuera de Zoom Meetings

El diagrama anterior muestra cómo, fuera de Zoom Meetings, My Notes funciona a través del audio del dispositivo local del usuario en lugar de a través de una sesión compartida de Zoom Meetings. Si se habilita durante una reunión de terceros o una discusión en persona, My Notes puede usar el acceso a nivel del sistema al micrófono del usuario y, cuando corresponda, al audio del sistema para capturar el audio local disponible en ese Dispositivo. Luego, este audio se enruta a través de una sesión de MMR de un solo usuario y se procesa mediante el servicio de Reconocimiento Automático de Voz (ASR) de Zoom para generar una transcripción, que se entrega al Dispositivo del usuario y luego puede ayudar a generar notas posteriores a la reunión.
Esto significa que, fuera de Zoom Meetings, la transcripción se basa exclusivamente en el audio transmitido desde el Dispositivo local del usuario, en lugar de desde un flujo de audio compartido de una reunión de Zoom. My Notes también puede indicar al usuario que comience una nueva nota cuando se detecta actividad del micrófono del Dispositivo, ayudando a mostrar esta Características en situaciones como reuniones de terceros, grabaciones basadas en navegador u otros flujos de trabajo con micrófono activo. Al igual que en el flujo en la reunión, el audio usado para la transcripción no se conserva después de que la transcripción se completa, mientras que las notas y transcripciones resultantes pueden permanecer guardadas en la cuenta del usuario según la Configuración de retención aplicable.
ZoomMate

El diagrama anterior ilustra cómo ZoomMate funciona como una superficie de trabajo principal dentro de Zoom Workplace, operando en el punto donde el contexto del usuario, el conocimiento conectado y las capacidades de ejecución convergen. En lugar de existir solo como un asistente independiente, ZoomMate se sitúa en el centro de un entorno de trabajo más amplio en el que los usuarios pueden buscar, razonar, crear y actuar en todos los materiales y sistemas que respaldan su trabajo diario.
Una parte importante de este rol proviene del Acceso de ZoomMate a contenido propio de Zoom. Esto puede incluir elementos como resúmenes, Mis notas, grabaciones, documentos de Canvas, mensajes de chat y otros materiales creados por el usuario en toda la plataforma de Zoom. Estos elementos ayudan a proporcionar a ZoomMate el contexto que necesita para responder preguntas, sintetizar información, generar resultados y respaldar el seguimiento. ZoomMate también puede usar memoria, lo que le permite incorporar preferencias relevantes del usuario o detalles relacionados con el trabajo al ayudar a completar una tarea.
El diagrama también muestra cómo ZoomMate se extiende más allá del contenido nativo de Zoom al integrarse con fuentes de conocimiento de terceros. Por ejemplo, los servicios conectados de Almacenamiento en la nube, como Google Drive o OneDrive, pueden servir como repositorios externos de información accesible para el usuario. Cuando estas fuentes se integran, Zoom puede indexar contenido aprobado para respaldar la recuperación en esos materiales, lo que permite a ZoomMate usar búsqueda agéntica para trabajar tanto con el contenido de Zoom como con el conocimiento conectado de terceros. De esta manera, ZoomMate puede buscar no solo en lo que existe dentro de Zoom, sino también en los documentos y materiales a los que un usuario está autorizado a acceder en plataformas externas conectadas.
Otras fuentes de datos personales, como correo electrónico y calendario (excluidos los correos electrónicos cifrados de extremo a extremo), también pueden dar soporte a ZoomMate, pero funcionan de manera diferente. En lugar de indexarse, estas fuentes generalmente se comunican con ZoomMate mediante recuperación directa basada en API. Esto las hace útiles para tareas como localizar contexto relevante del correo electrónico, revisar información del calendario o ayudar a Programar eventos, sin tratarlas como parte de la capa de recuperación indexada utilizada para una búsqueda de documentos más amplia.
El diagrama también refleja que ZoomMate puede conectarse con una gama más amplia de servicios y conectores de terceros que admiten la realización de acciones además del acceso al conocimiento. Estos pueden incluir sistemas como Jira, HubSpot, ServiceNow, Workday y otras plataformas Comerciales conectadas. A través de estas conexiones, ZoomMate puede realizar tareas agénticas en nombre del usuario, como crear o actualizar registros, recuperar información de servicios externos o llevar a cabo otras acciones conectadas dentro de esos sistemas. Esto hace que ZoomMate sea más que una superficie de recuperación y síntesis; también funciona como una capa de ejecución que puede ayudar a convertir el contexto en acción.
Esta misma base también ayuda a impulsar agentes y flujos de trabajo dentro del entorno de ZoomMate. Los agentes pueden usar el mismo contexto subyacente, las mismas rutas de recuperación y los sistemas conectados para realizar una asistencia más dinámica, basada en el razonamiento, ayudando a los usuarios a llevar a cabo tareas más amplias de varios pasos con mayor continuidad y adaptabilidad. Los flujos de trabajo, por el contrario, pueden ofrecer una automatización más estructurada y repetible, permitiendo a los usuarios definir procesos recurrentes que operan en todo el contenido de Zoom y, cuando sea compatible, en sistemas externos conectados. De esta manera, ZoomMate no solo funciona como una interfaz conversacional, sino también como un punto de orquestación tanto para la actividad agéntica dinámica como para una automatización más estructurada.
Entorno aislado también puede brindar Soporte a algunas de las capacidades de ejecución más avanzadas de ZoomMate. Para tareas que requieren ejecución de código, generación de archivos, automatización u otro procesamiento más sofisticado, ZoomMate puede usar un entorno aislado separado en lugar de depender solo del procesamiento conversacional Estándar. Este entorno aislado se ejecuta en la infraestructura AWS de Zoom y proporciona una capa de ejecución aislada y de corta duración para tareas de mayor complejidad, ayudando a ZoomMate a llevar a cabo ciertas operaciones en un entorno más controlado. De esta manera, la misma base más amplia de ZoomMate que admite la recuperación, el razonamiento, los agentes y los flujos de trabajo también puede brindar Soporte a una ejecución de tareas más avanzada cuando el trabajo solicitado lo requiera.
Por último, el diagrama no representa todos los componentes subyacentes que ayudan a impulsar ZoomMate. No pretende Mostrar explícitamente capas de capacidades fundamentales como las habilidades, ni otras estructuras de Soporte que forman parte de la infraestructura y el diseño más amplios de Zoom AI. Se supone que esos elementos operan dentro del sistema de IA subyacente que habilita el comportamiento de ZoomMate. El propósito de este diagrama es más bien Mostrar los principales contextos, conocimientos y superficies de acción a través de los cuales ZoomMate funciona como una superficie de trabajo unificada en Zoom y en los sistemas conectados.
Conexiones de terceros e indexación de ZoomMate

El diagrama anterior ilustra dos partes relacionadas pero distintas de la arquitectura de datos de terceros de ZoomMate. La primera es cómo ZoomMate se conecta con aplicaciones y servicios de terceros compatibles para poder recuperar información o actuar dentro de esos sistemas. La segunda es cómo ciertas fuentes de contenido de terceros compatibles pueden ingerirse e indexarse para que ZoomMate pueda recuperar ese contenido más eficientemente más adelante mediante generación aumentada por recuperación.
ZoomMate puede conectarse directamente a aplicaciones y servicios de terceros
Una parte del diagrama muestra cómo ZoomMate se conecta a aplicaciones de terceros admitidas como Jira, Confluence, Salesforce, ServiceNow, Workday, plataformas de almacenamiento en la nube y otros sistemas Comercial externos. Estas conexiones permiten que ZoomMate funcione más allá del contenido nativo de Zoom al interactuar con herramientas que almacenan datos Comercial o respaldan el trabajo operativo fuera de la plataforma Zoom.
Estas conexiones se establecen mediante una conexión TLS a través de modelos de Acceso autorizados, como integraciones basadas en API o conexiones basadas en MCP. En cualquiera de los casos, ZoomMate opera dentro de los Permiso concedidos por el servicio conectado. Esto permite a ZoomMate recuperar información relevante de esos sistemas y, cuando sea compatible, realizar acciones dentro de ellos en nombre del usuario. Por ejemplo, ZoomMate puede recuperar detalles de un elemento de Jira, buscar una página de Confluence, actualizar un registro en ServiceNow o usar otro sistema conectado como parte de la ejecución de una tarea más amplia.
Este modelo de conexión directa es especialmente importante para tareas que dependen del estado actual del sistema o del Acceso en vivo a herramientas de terceros. En esos casos, ZoomMate puede usar la aplicación conectada como un punto de conexión de servicio activo en lugar de solo como un repositorio de contenido indexado previamente.
ZoomMate puede indexar contenido aprobado de terceros para su posterior recuperación
Una segunda parte del diagrama muestra cómo ZoomMate puede ingerir e indexar contenido de fuentes de terceros admitidas para que el material pueda recuperarse más adelante como parte de una búsqueda o una respuesta asistida por IA. Este modelo de recuperación indexada es más relevante para repositorios de contenido conectados como sistemas de Almacenamiento en la nube, bases de conocimiento, plataformas de documento y otras fuentes admitidas donde ZoomMate puede necesitar buscar en un conjunto más amplio de contenido externo conservado.
Una vez que una fuente admitida se conecta y se aprueba para su indexación, ZoomMate puede recuperar contenido de esa fuente y prepararlo para una búsqueda posterior. Este proceso de preparación puede incluir dividir archivos o registros más grandes en unidades más pequeñas y adjuntar metadatos como la fuente, la hora de actualización, la propiedad y la información de Permiso. Ese contenido se escribe luego en la capa de indexación de Zoom para que más tarde pueda buscarse mediante coincidencia exacta y recuperación basada en el significado.
Cuando un usuario envía una solicitud que depende de contenido indexado de terceros, ZoomMate puede buscar ese material indexado, evaluar qué resultados son los más relevantes y aplicar la información de Permiso asociada con la fuente original para que solo el contenido autorizado sea elegible para aparecer. Luego, el contenido autorizado más relevante puede pasarse a la capa de IA de ZoomMate como contexto de apoyo para la respuesta. De este modo, el diagrama muestra cómo el contenido indexado de terceros puede ayudar a ZoomMate a producir respuestas fundamentadas en materiales Comercial conectados reales en lugar de basarse solo en el conocimiento general del modelo.
Avatares personalizados
Creación de avatar

El diagrama anterior ilustra cómo se crea un avatar personalizado a partir del video y la voz grabados de un usuario. El proceso comienza cuando se le presenta al usuario un guion y se le solicita que se grabe leyéndolo. Este paso guiado de grabación permite a Zoom capturar el material audiovisual necesario para generar tanto la apariencia del avatar del usuario como el modelo de voz asociado que se utiliza en resultados posteriores basados en avatares.
Después de que el usuario completa la grabación, los componentes de audio y video se procesan por rutas diferentes. El audio se envía a un servicio de terceros que genera una semejanza de voz basada en el habla grabada del usuario. Una vez completado ese procesamiento, el servicio de terceros devuelve a Zoom un identificador de voz único. Zoom almacena este identificador como la referencia de voz del usuario para poder usarlo más adelante al generar clips basados en avatares u otros resultados compatibles que dependen de esa voz sintetizada.
Al mismo tiempo, el componente de video se envía a un módulo de generación de avatares alojado por Zoom, donde Zoom procesa el material visual grabado para crear la representación del avatar del usuario. Esto da como resultado una plantilla de avatar que Zoom almacena para uso futuro. En conjunto, estas dos salidas conservadas —el identificador de voz almacenado y la plantilla de avatar almacenada— permiten a Zoom generar futuros clips o contenido basado en avatares que reflejen tanto la apariencia del usuario como su voz sintetizada.
Creación de clips

El diagrama anterior ilustra cómo se crea un clip de avatar personalizado a partir del avatar almacenado y el perfil de voz sintetizada de un usuario. El proceso comienza cuando el usuario carga el guion que quiere que el avatar presente. Ese guion sirve como contenido de origen para el clip generado. A partir de ahí, el backend web de Zoom coordina dos entradas paralelas necesarias para crear el resultado final. Primero, envía el identificador de voz almacenado del usuario junto con el guion al servicio de generación de voz de terceros, que produce el audio del clip usando la voz sintetizada del usuario. En segundo lugar, envía la plantilla de avatar almacenada del usuario al módulo de generación de avatares de Zoom para que el componente visual del clip pueda prepararse usando la apariencia de avatar previamente creada del usuario. Una vez que el servicio de generación de voz de terceros ha producido el audio, ese audio se devuelve a Zoom y se pasa al módulo de generación de avatares. Luego, el módulo de generación de avatares combina la plantilla de avatar almacenada con el audio de voz generado, sincronizando los movimientos faciales y de la boca del avatar con el contenido hablado. Después de que este proceso de sincronización labial y renderizado se complete, Zoom produce el clip de avatar terminado y se lo entrega al usuario.
Diccionario personalizado

El diagrama anterior ilustra cómo las Características de Diccionario Personalizado ayudan a mejorar la precisión de los resultados de Zoom basados en voz al proporcionar al servicio de Reconocimiento Automático del Habla (ASR) de Zoom contexto adicional de vocabulario. Estas Características están diseñadas para admitir palabras, abreviaturas, jerga, nombres de productos o terminología especializada que puedan ser específicos de una empresa, sector, equipo o región y que, de otro modo, podrían no reconocerse o representarse correctamente durante la transcripción.
El proceso comienza cuando un administrador de cuenta crea y almacena un diccionario personalizado en el portal web de Zoom. Ese diccionario contiene la lista de palabras o frases aprobadas que la Organización quiere que Zoom reconozca con mayor precisión. Una vez que el diccionario se ha guardado a nivel de cuenta, pasa a estar Disponible para su uso en contextos de reunión y procesamiento del habla compatibles.
Cuando un usuario inicia posteriormente una reunión, el servicio AASR de Zoom puede recibir el diccionario personalizado de la cuenta como parte de su contexto de procesamiento. A medida que el servicio ASR convierte el audio en vivo en datos de transcripción, puede comparar el lenguaje hablado percibido con el diccionario personalizado e intentar asociar los sonidos reconocidos con los términos almacenados. Esto le da a ASR orientación adicional sobre qué palabras buscar, cómo pueden escribirse ciertos términos y cómo deben interpretarse las abreviaturas o el lenguaje especializado.
El resultado es que la salida inicial de voz a texto puede reflejar con mayor precisión la terminología realmente utilizada en la reunión. Esa mayor precisión luego puede trasladarse a artefactos posteriores derivados de la conversación. Por ejemplo, si más tarde se genera un resumen de la reunión, subtítulos, transcripción u otro recurso basado en datos de voz a texto, esos resultados pueden reflejar una representación más precisa de las palabras pronunciadas durante la reunión, lo que ayuda a mejorar la calidad y la utilidad del artefacto generado por Zoom AI.
Aislamiento de audio personal

El diagrama anterior ilustra cómo se generan los resúmenes de la reunión personalizados a partir de una plantilla definida por el usuario o por la cuenta. El proceso comienza cuando se crea y se guarda una plantilla en Zoom. A nivel de cuenta, un administrador puede definir una plantilla personalizada de resumen de la reunión para uso organizacional. A nivel individual, un usuario puede crear una plantilla personal de resumen de la reunión según sus propias preferencias. Una vez creada, la plantilla seleccionada se almacena para que pueda aplicarse durante la generación posterior del resumen.
A medida que concluye una reunión, Zoom AI puede usar los datos de voz a texto de la reunión para generar un resumen que siga la estructura y el énfasis de la plantilla personalizada elegida. Si la plantilla personalizada se seleccionó antes de que se generara el resumen de la reunión, Zoom AI aplica esa plantilla directamente al producir el resumen. Esto permite que el resultado refleje el formato, las secciones o las prioridades específicas definidas en la plantilla, en lugar de limitarse solo a una estructura predeterminada del resumen.
Si no se seleccionó una plantilla personalizada antes de que el resumen se generara por primera vez, Zoom solo puede aplicar esa plantilla más tarde si se conservó la transcripción de la reunión. En ese caso, Zoom AI puede volver a procesar la transcripción conservada usando la configuración de la plantilla y producir un nuevo resumen alineado con esa estructura. Sin embargo, si no se conservó la transcripción, Zoom no dispone de la transcripción subyacente para volver a procesarla, lo que significa que la plantilla personalizada no puede aplicarse después.
Aislamiento de audio personal

El diagrama anterior ilustra cómo Aislamiento de audio personal funciona usando una huella de voz almacenada localmente en el Dispositivo del usuario para distinguir el habla del usuario del Ruido de fondo circundante. El proceso comienza cuando el usuario graba una muestra de voz mediante las Características de Aislamiento de audio personal en la aplicación Zoom Workplace. Esa grabación se usa para crear una huella de voz local que ayuda a la aplicación a reconocer las características de la voz del usuario. Esta huella de voz permanece en la máquina local y no se transmite a la nube de Zoom.
Cuando el usuario habla posteriormente durante una reunión en un entorno con ruido ambiental, la aplicación Zoom Workplace usa esa huella de voz almacenada localmente para ayudar a identificar los patrones de habla del usuario y separarlos de los sonidos circundantes. Esto permite a la aplicación Reducir el ruido de fondo y aislar la voz del usuario de manera más eficaz antes de que el audio se envíe más adelante a través del flujo de la reunión.
Como resultado, el audio transmitido a la nube de Zoom es el audio de la reunión refinado con el ruido ambiental filtrado en la medida en que lo admiten las Características. La propia huella de voz subyacente del usuario no se envía a la infraestructura de nube de Zoom. De este modo, Aislamiento de audio personal opera como una Características de procesamiento a nivel de Dispositivo local que mejora la claridad del audio antes de que el audio limpio se transmita a la sesión en vivo de Zoom.
Última actualización
¿Te fue útil?

