> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/es/ai-whitepaper/diagrams.md).

# Diagramas y flujos de datos

Las capacidades de IA de Zoom abarcan una amplia gama de productos, servicios y flujos de trabajo, lo que significa que ningún diagrama único puede captar de forma razonable o completa cómo funciona la IA en toda la plataforma de Zoom. Distintas características dependen de diferentes entradas, rutas de procesamiento, comportamientos de almacenamiento, interacciones de modelos y salidas. Algunas operan solo con datos en vivo y efímeros durante una interacción activa, mientras que otras crean artefactos retenidos que más adelante pueden dar soporte a características adicionales. Algunas funciones permanecen completamente dentro del entorno de primera parte de Zoom, mientras que otras dependen de la arquitectura de IA federada de Zoom y, en algunos casos, de sistemas externos conectados. Para facilitar la comprensión de este sistema dinámico y amplio, esta página presenta una serie de diagramas en lugar de basarse en un único modelo visual. Cada uno destaca una capa, una ruta o un patrón de características diferente dentro de la plataforma más amplia de Zoom AI. Al final de estas secciones hay tablas que describen qué características son aplicables, su producto asociado y el estado de retención de sus artefactos. Las secciones posteriores examinan entonces ciertas características de producto a medida de forma individual, ofreciendo explicaciones más centradas de cómo funcionan esas capacidades específicas.

La secuencia comienza a continuación con una visión general simplificada de Zoom AI en su forma más básica, mostrando la plataforma en un estado centrado en primera parte que utiliza la arquitectura de modelo federado estándar de Zoom, pero que aún no introduce integraciones empresariales de terceros ni fuentes externas de datos de clientes más allá de los proveedores de modelos de IA de terceros de Zoom. A partir de ahí, los diagramas introducen gradualmente partes más especializadas de la plataforma, incluidas las opciones de enfoque de IA de Zoom, la transformación del audio en vivo en artefactos utilizables por la IA y las formas en que esos artefactos pueden más adelante dar soporte a otras características y flujos de trabajo. En conjunto, estos diagramas están pensados para hacer que un sistema muy complejo resulte más accesible, desglosándolo en vistas más pequeñas y fáciles de seguir que reflejan cómo funcionan en la práctica las distintas partes de la plataforma de IA de Zoom.

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/812198f1e54412fddc759fd22d84a4e46647ea96" alt=""><figcaption><p>Una visión general sencilla de Zoom AI</p></figcaption></figure></div>

El diagrama anterior presenta la plataforma de IA de Zoom en una forma simplificada, mostrando la plataforma en uno de sus estados más fundamentales. Ilustra cómo distintas partes de la arquitectura general de productos y servicios de Zoom conocida como el backend web de Zoom —incluidas áreas como Reuniones, Teléfono, centro de contacto, reconocimiento automático del habla y otras ofertas de Zoom— alimentan la plataforma más amplia de Zoom y contribuyen al conjunto de contenido accesible para el usuario que puede dar soporte a la funcionalidad de IA posterior.

Un concepto central en este diagrama es **contenido de usuario de Zoom**. Esto se refiere al contenido generado a través de las interacciones de un usuario con los productos y servicios de Zoom que más adelante puede servir como entrada, contexto o artefactos para experiencias impulsadas por IA. Según el producto y la característica implicados, esto puede incluir materiales como mensajes de Zoom Chat, resúmenes de la reunión, transcripciones, documentos de Zoom Canvas, Mis notas, grabaciones y otros artefactos similares orientados al usuario. Estos materiales forman una parte importante de la capa contextual que puede respaldar posteriormente la recuperación asistida por IA, el razonamiento, la síntesis y el seguimiento.

Parte de este contenido también puede prepararse para un uso futuro de IA mediante una infraestructura de recuperación, como la recuperación indexada o los módulos de generación aumentada por recuperación. En esos casos, los artefactos relevantes pueden ingerirse e indexarse para que puedan localizarse y utilizarse con mayor eficiencia en consultas o procesos de IA posteriores. Esto ayuda a que Zoom AI no solo funcione con interacciones en vivo, sino también con contexto retenido y materiales anteriores generados por el usuario en toda la plataforma.

Por último, el diagrama también introduce **Zoom AI** se presenta como la capa compartida de IA que opera en todo este ecosistema más amplio. En esta vista simplificada, Zoom AI se muestra mediante el enfoque federado estándar de Zoom, en el que Zoom puede utilizar tanto modelos alojados en Zoom que se ejecutan dentro de la propia infraestructura de Zoom como proveedores de modelos de IA de terceros seleccionados cuando resulta apropiado para la tarea en cuestión. Este modelo federado permite a Zoom enrutar las tareas de IA al entorno de modelo disponible más adecuado, manteniendo al mismo tiempo una experiencia de IA unificada en toda la plataforma.

## Enfoques del modelo de servicio de Zoom AI

<div data-with-frame="true"><figure><img src="/files/a12f3cb486dc1924a80a2dd1034dcab8bca10800" alt=""><figcaption><p>Resumen de los enfoques de IA de Zoom, incluidos Federado, ZM+ y ZMO</p></figcaption></figure></div>

El diagrama anterior ilustra los tres enfoques de IA de Zoom: el Enfoque Federado, Modelos alojados en Zoom Plus (ZM+) y Solo modelos alojados en Zoom (ZMO). En conjunto, estos representan las tres formas principales en que Zoom ofrece servicios de IA a los clientes, cada una con un equilibrio diferente entre amplitud de características, flexibilidad del modelo y control de los datos.

El Enfoque Federado es el enfoque estándar y más completo de Zoom. Permite a Zoom trabajar con múltiples proveedores de IA, incluidos modelos alojados en Zoom y socios seleccionados de modelos de terceros, de modo que las tareas puedan enrutarse al modelo más adecuado para la solicitud. ZM+ proporciona un modelo de implementación más controlado al usar instancias de modelos dedicadas gestionadas por Zoom, mientras que Solo modelos alojados en Zoom (ZMO) mantiene el procesamiento de IA únicamente dentro de los modelos alojados en Zoom, ofreciendo la ruta de modelo más restrictiva y controlada, pero con un conjunto de características más limitado.

Para los fines de esta página, los diagramas que siguen generalmente ilustran el enfoque federado, ya que refleja el enfoque estándar de Zoom y la visión más amplia de la funcionalidad de Zoom AI. Las organizaciones que usan ZM+ o ZMO a menudo pueden interpretar estos mismos diagramas eliminando mentalmente a los proveedores de modelos de IA de terceros y centrándose en las partes restantes del flujo gestionadas por Zoom.

Consulte la página Modelos, procesamiento, almacenamiento y uso de Zoom AI para obtener más información.

## Características de medios en vivo y artefactos

<div data-with-frame="true"><figure><img src="/files/8617129353752628d5c976e5494a5f29b94a5188" alt=""><figcaption><p>Resumen de cómo los medios en vivo se transforman en datos de voz a texto que impulsan las características de Zoom AI</p></figcaption></figure></div>

El diagrama anterior ilustra cómo las interacciones de medios en vivo —como reuniones y llamadas telefónicas— pueden producir características y artefactos impulsados por IA posteriores en toda la plataforma de Zoom. En cada caso, el audio en vivo entra en Zoom a través del punto de conexión asociado con ese producto o servicio. Para las reuniones, esto suele ser el **Enrutador multimedia (MMR)**. Para telefonía, el audio generalmente entra a través de **zonas SIP**.

Una vez que el audio se ingiere, se enruta al servicio de Zoom de **Reconocimiento automático del habla (ASR)** servicio, que convierte el audio en vivo en **datos de voz a texto**. Esos datos de voz a texto pueden usarse de múltiples maneras según la configuración y las características habilitadas. En algunos casos, se entregan de inmediato a los usuarios como **subtítulos en vivo**. En contextos compatibles, también puede pasarse al servicio de Zoom de **Traducción en vivo** servicio, que traduce la salida de voz a texto en subtítulos traducidos para los participantes en otros idiomas.

Los datos de voz a texto también pueden dar soporte a características más persistentes o derivadas. Si **transcripción** está habilitada, o si un usuario está usando **Mis notas**, el servicio de ASR puede producir una transcripción después de que concluya la sesión en vivo. Sin embargo, si la retención de la transcripción no está habilitada, los datos de voz a texto usados durante la interacción no se retienen como una transcripción persistente. Incluso en esos casos, Zoom AI aún puede usar los datos de voz a texto de forma efímera durante la sesión para dar soporte a características de IA en vivo.

Por ejemplo, un usuario puede hacer **preguntas durante la reunión** a través de Zoom AI durante una reunión. En ese caso, Zoom AI puede usar los datos de voz a texto en vivo de la reunión para interpretar la pregunta del usuario y generar una respuesta relevante basada en la conversación en curso.

Una distinción clave en este flujo es que Zoom AI no necesariamente conserva una transcripción de la conversación solo porque se usaron datos de voz a texto durante la sesión. A menos que la retención de la transcripción esté habilitada específicamente, o que los datos se estén reteniendo mediante una característica como **Mis notas**, los propios datos de voz a texto pueden seguir siendo efímeros. Al mismo tiempo, algunos artefactos posteriores producidos a partir de esos datos pueden persistir. Por ejemplo, si un usuario hace preguntas durante una reunión, la conversación de IA resultante o las notas relacionadas pueden permanecer más adelante como un artefacto retenido incluso cuando no se produce una transcripción persistente.

Algunos artefactos retenidos también pueden convertirse en la base de artefactos y flujos de trabajo posteriores adicionales. Un resumen de la reunión, un resumen del seminario web, un resumen de la llamada o las Mis notas de un usuario pueden convertirse en un **documento de Zoom Canvas, donde puede seguir editándose, ampliándose y usándose como artefacto de trabajo. A su vez, esos documentos resultantes pueden servir más adelante como contexto para otras características o flujos de trabajo de IA discutidos en otra parte de este documento. De este modo, el audio en vivo puede dar lugar no solo a características inmediatas de IA, sino también a una cadena de artefactos retenidos que continúan dando soporte al trabajo asistido por IA más adelante en toda la plataforma de Zoom.** documento de Zoom Canvas

Este diagrama es aplicable a las siguientes características:

|         Características        |                                                     Descripción                                                    |        Producto(s)        | Retención de artefactos |
| :----------------------------: | :----------------------------------------------------------------------------------------------------------------: | :-----------------------: | :---------------------: |
|       Subtítulos en vivo       |                           Subtítulos de voz a texto en tiempo real para sesiones en vivo.                          | Reuniones, seminarios web |       No retenido       |
|      subtítulos traducidos     |              Subtítulos traducidos en tiempo real generados a partir de datos de voz a texto en vivo.              | Reuniones, seminarios web |       No retenido       |
|         Transcripciones        |                      Registros de texto retenidos del contenido de voz a texto de la reunión.                      |    Reuniones, Teléfono    |         Retenido        |
|      resumen de la reunión     | Resumen generado por IA de los puntos clave de la discusión de la reunión, las decisiones y las tareas pendientes. |         Reuniones         |         Retenido        |
|    Resumen del seminario web   |           Resumen generado por IA del contenido clave del seminario web compartido después de la sesión.           |       Seminarios web      |         Retenido        |
|      Resumen de la llamada     |            Resumen posterior a la llamada generado por IA de los detalles clave y las tareas pendientes.           |          Teléfono         |         Retenido        |
|            Mis notas           |     Notas personales, transcripción y contexto de la reunión retenidos para referencia posterior y seguimiento.    |         Reuniones         |         Retenido        |
|      Tareas de seguimiento     |                Acciones de seguimiento sugeridas por IA basadas en los detalles de la conversación.                |         Zoom Tasks        |         Retenido        |
| Priorización del correo de voz |           Clasificación basada en IA de los correos de voz según la importancia definida por el usuario.           |          Teléfono         |         Retenido        |
|     Preguntas de la reunión    |              Respuestas de IA a las preguntas de la reunión usando el contexto de la reunión en vivo.              |         Reuniones         |         Retenido        |
|   Preguntas del seminario web  |          Respuestas de IA a las preguntas del seminario web usando el contexto del seminario web en vivo.          |       Seminarios web      |         Retenido        |
|     Preguntas de la llamada    |              Respuestas de IA a las preguntas de la llamada usando el contexto de la llamada en vivo.              |          Teléfono         |         Retenido        |

## Funciones de grabación

<div data-with-frame="true"><figure><img src="/files/99f6e9cb356561866b85f8fd33b14ada4bbe06ed" alt=""><figcaption><p>Descripción general de cómo Zoom procesa las grabaciones y las funciones de IA</p></figcaption></figure></div>

El diagrama anterior ilustra cómo Zoom AI admite **funciones de IA basadas en grabaciones** al operar sobre la grabación completada después de que la sesión en vivo ha finalizado. Al igual que otras experiencias de Zoom basadas en audio, el medio original entra a través de la infraestructura asociada con el producto en uso, como la **MMR** para reuniones o la correspondiente **zona SIP** para telefonía. Como parte de ese flujo, la grabación se crea y se envía al servicio de grabación de Zoom, donde luego la grabación completada se almacena en el almacenamiento de contenido de Zoom.

Una vez que la grabación ha sido finalizada, el audio asociado con esa grabación se envía al servicio de Zoom para transcripción. Este proceso produce una **Reconocimiento automático del habla (ASR)** transcripción específica de la grabación **transcripción**que puede diferir de los datos de voz a texto generados durante la propia sesión en vivo. En otras palabras, la transcripción asociada con una grabación completada se genera como parte del flujo de procesamiento posterior a la grabación y no simplemente se copia de la capa de interacción en vivo.

Después de que se produce la transcripción de la grabación, esta puede enviarse a **Zoom AI** para un análisis adicional. En esta etapa, Zoom AI procesa la transcripción para identificar artefactos de grabación de nivel superior, como resúmenes, destacados, capítulos y otras representaciones estructuradas de la conversación. Este análisis se realiza utilizando la capa de procesamiento de IA de Zoom, incluidos los modelos alojados por Zoom cuando corresponda, para transformar la transcripción bruta de la grabación en resultados posteriores a la reunión o a la llamada más útiles.

Una vez que ese análisis se completa, los artefactos generados por IA resultantes se asocian con la propia grabación. Esto es lo que permite a los usuarios que ven una grabación ver no solo la grabación y la transcripción, sino también las capas adicionales generadas por IA que facilitan la navegación y la comprensión del contenido. De esta manera, el diagrama muestra cómo una grabación completada puede convertirse en la base para una segunda etapa de procesamiento de IA, produciendo funciones de grabación enriquecidas que van más allá del medio original almacenado.

Este diagrama es aplicable a las siguientes características:

|                    Características                    |                                                                             Descripción                                                                            | Producto(s) | Retención de artefactos |
| :---------------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------: | :---------------------: |
|                 grabación inteligente                 |                                         Aspectos destacados, capítulos y resúmenes generados por IA para reuniones grabadas                                        |  Reuniones  |         Retenido        |
|       Generar títulos, descripciones y etiquetas      |                                                   Títulos, descripciones y etiquetas generados por IA para clips.                                                  |    Clips    |         Retenido        |
| Creación de contenido de IA para grabaciones y videos | Utiliza transcripciones de grabación del Evento para generar contenido escrito y fragmentos de video seleccionados por IA a partir de momentos clave de la sesión. | Zoom Events |         Retenido        |

## Funciones derivadas de IA

<div data-with-frame="true"><figure><img src="/files/1171aaa20f7a7b19709423cddef60ed0052f0b30" alt=""><figcaption><p>Descripción general de cómo Zoom procesa las funciones de generación de contenido de IA derivado</p></figcaption></figure></div>

El diagrama anterior ilustra cómo **funciones derivadas de IA** opera utilizando contenido Disponible del usuario como contexto para tareas y resultados posteriores asistidos por IA. En estos casos, Zoom AI ya no trabaja solo con datos de interacción en vivo. En su lugar, se basa en artefactos que ya existen dentro del entorno de contenido más amplio del usuario para responder una pregunta, sintetizar información o ayudar a producir un nuevo resultado.

Dependiendo de la tarea, este material contextual puede incluir artefactos como mensajes de chat, resúmenes de reunión, Mis notas, transcripciones, documentos de Zoom Canvas, Zoom Slide decks, documentos de Zoom Paper, contenido de Zoom Mail o Zoom Calendar, datos de correo electrónico o de calendario de terceros conectados, o archivos cargados por el usuario para respaldar una solicitud en particular. De este modo, Zoom AI está usando artefactos de Zoom creados previamente, junto con datos a nivel personal cuando estén disponibles, para ayudar a lograr el objetivo final solicitado por el usuario.

El diagrama también refleja que este proceso puede generar **nuevo contenido de usuario**. Por ejemplo, Zoom AI puede usar materiales existentes para crear una nueva hoja de Zoom, un documento de Zoom Canvas, una presentación de diapositivas de Zoom o un documento de Zoom Paper. Una vez creados, esos nuevos artefactos pasan a formar parte del repositorio de contenido más amplio del usuario y, más adelante, pueden volver a utilizarse como contexto para futuras funciones y flujos de trabajo asistidos por IA. Esto crea una progresión por capas en la que el contenido anterior del usuario puede respaldar resultados posteriores, y esos resultados, a su vez, pueden convertirse con el tiempo en nuevos artefactos contextuales.

Este mismo patrón también puede aparecer en otras superficies de Zoom. En entornos como **Zoom hub** o el **panel de chat de IA**, los usuarios pueden hacer preguntas a través de la plataforma o interactuar con documentos y materiales accesibles para el usuario a través de la suite de productividad de Zoom AI. En esos casos, Zoom AI vuelve a trabajar a partir de los artefactos existentes accesibles para el usuario para proporcionar recuperación, síntesis, respuesta a preguntas o seguimiento, mostrando cómo las funciones derivadas de IA amplían el valor del contenido previo hacia nuevas tareas y resultados.

{% hint style="info" %}
**Nota**

Cargas de archivos locales del usuario [pueden deshabilitarse](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

Este diagrama es aplicable a las siguientes características:

|     Características     |                                                                                       Descripción                                                                                      |          Producto(s)          | Retención de artefactos |
| :---------------------: | :------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------------------------: | :---------------------: |
| Generación de contenido | La generación de contenido usa IA para crear, refinar, resumir y organizar documentos, presentaciones, hojas de cálculo y otros resultados a partir de indicaciones en Idioma natural. | Canvas, Sheets, Paper, Slides |         Retenido        |
|   panel de chat de IA   |                               Asistencia de IA conversacional para hacer preguntas, generar contenido y trabajar en todo el contexto de Zoom Disponible.                               |      panel de chat de IA      |         Retenido        |
|     Hacer preguntas     |                                                Respuestas generadas por IA basadas en documentos y materiales seleccionados en Zoom hub.                                               |              hub              |         Retenido        |

## Características generativas y de composición

<div data-with-frame="true"><figure><img src="/files/be25b283e65768a5b8d16f9e18457a32a9b5521e" alt=""><figcaption><p>Descripción general de cómo Zoom procesa las solicitudes de IA generativa y de composición</p></figcaption></figure></div>

El diagrama anterior ilustra cómo **funciones generativas y de composición** funcionar dentro de la plataforma Zoom AI. A diferencia de las funciones de IA derivadas, que dependen del contenido preexistente del usuario para ayudar a lograr una tarea o un resultado posterior, las funciones generativas y de composición suelen estar impulsadas más directamente por la entrada inmediata del usuario. En muchos casos, estas funciones no dependen de artefactos de Zoom conservados que ya estén almacenados en otra parte del entorno de contenido del usuario. En cambio, se alimentan principalmente de indicaciones directas del usuario, consultas, archivos cargados o del contenido inmediato en pantalla asociado con la experiencia activa del producto.

Esta distinción es especialmente importante para las funciones que trabajan a partir del contenido visible en el contexto actual del usuario, en lugar de hacerlo a partir de artefactos indexados o retenidos previamente. Por ejemplo, cuando un usuario resume un hilo de chat, resume un correo electrónico o le pide a Zoom AI que redacte una respuesta a un correo electrónico, el contenido relevante normalmente se toma del contexto activo del cliente y se empaqueta en una carga útil de solicitud para el procesamiento de Zoom AI. En otras palabras, Zoom no necesariamente recupera ese contenido de un repositorio separado del lado del servidor para completar la tarea. En cambio, la información relevante del hilo activo, el conjunto de mensajes u otro contexto visible de la interfaz se convierte en forma de texto y se envía a Zoom AI desde la aplicación Zoom Workplace para que el servicio pueda realizar procesamiento del lenguaje natural, resumido o generación.

El diagrama también incluye casos de uso generativos que dependen principalmente de instrucciones directas del usuario en lugar de material fuente textual. Por ejemplo, cuando un usuario solicita la generación de imágenes, el usuario describe el resultado deseado mediante un prompt y el modelo genera la imagen en función de esa descripción. En algunos contextos de producto, como Zoom Whiteboard, esta generación de imágenes puede depender de proveedores de modelos de IA de terceros. En otros contextos, Zoom puede usar sus propios modelos alojados. Por ejemplo, la generación de imágenes de fondo virtual de Zoom puede depender de un modelo alojado por Zoom que usa embeddings y procesamiento relacionado para generar salidas visuales, y el contenido resultante pasa por controles de moderación antes de devolverse al usuario.

En conjunto, el diagrama muestra que las funciones generativas y de composición a menudo dependen menos de los artefactos conservados y más de la intención inmediata del usuario, el contexto activo del lado del cliente o los materiales de apoyo cargados. De esta manera, representan otro modo principal de funcionamiento de Zoom AI: no solo recuperar y razonar sobre contenido previo, sino también generar nuevos resultados directamente a partir de la solicitud actual del usuario y del contexto circundante.

Este diagrama es aplicable a las siguientes características:

|           Características           |                                                                                        Descripción                                                                                       |            Producto(s)            |  Retención de artefactos  |
| :---------------------------------: | :--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :-------------------------------: | :-----------------------: |
|            fondo virtual            |                             Usa IA para crear imágenes personalizadas de fondo virtual a partir de indicaciones del usuario para su uso en sesiones de Zoom.                             | Reuniones, Eventos, seminario web | Conservado (si se guarda) |
|        Generación de imágenes       |                         Usa IA para transformar dibujos de pizarra o artefactos visuales en bruto en resultados visuales más pulidos, renderizados o estilizados.                        |              pizarra              | Conservado (si se guarda) |
|        Generación de imágenes       |                Usa IA para crear imágenes de marca y otros recursos visuales para eventos, como encabezados, imágenes de la sesión y materiales relacionados con la expo.                |              Eventos              | Conservado (si se guarda) |
|       Generación de contenido       | Usa IA para generar contenido de pizarra en pantalla, como texto, notas adhesivas, tablas, mapas mentales y otros elementos visuales estructurados a partir de indicaciones del usuario. |              pizarra              | Conservado (si se guarda) |
|       Generación de contenido       |                       Usa IA para generar contenido escrito del Evento, como descripciones, detalles de la sesión, biografías de los ponentes y anuncios del lobby.                      |              Eventos              | Conservado (si se guarda) |
|  redacción de correos electrónicos  |                    Usa IA para redactar y perfeccionar contenido de correo electrónico, incluidos los cuerpos de los mensajes, las líneas de asunto y las respuestas.                    |         correo electrónico        |  Conservado (si se envía) |
|          Redacción de chat          |                             Usa IA para redactar y revisar mensajes de chat basados en indicaciones del usuario y el contexto de la conversación disponible.                             |                chat               |  Conservado (si se envía) |
|    Resumen de correo electrónico    |                                               Usa IA para resumir el contenido clave de un correo electrónico o hilo de correo electrónico.                                              |         correo electrónico        |        No retenido        |
| Mensaje, hilo, resumen de documento |                              Usa IA para resumir mensajes de chat, hilos de conversación y documentos adjuntos compatibles o contenido de Canvas vinculado.                              |                chat               |        No retenido        |
|          Carga inteligente          |                                 Extrae detalles del Evento de archivos cargados para crear automáticamente sesiones, ponentes y preguntas personalizadas.                                |            Zoom Events            | Conservado (si se guarda) |

## Mis notas

### Mis notas en Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/9a493f783c01699c97320abeb7155f8d26acb1c2" alt=""><figcaption><p>Descripción general de los flujos de datos de Mis notas en reuniones de Zoom</p></figcaption></figure></div>

El diagrama anterior muestra cómo, dentro de Zoom Meetings, Mis notas usa la ruta de audio existente de la reunión en lugar de depender de otro audio presente en el Dispositivo del usuario. Cuando Mis notas está habilitado durante una reunión de Zoom, accede al audio compartido de la reunión enrutado a través de la sesión del Multi-Media Router (MMR) de la reunión. Luego, ese audio es procesado por el servicio de Reconocimiento Automático del Habla (ASR) de Zoom para generar una transcripción, que se entrega al Dispositivo del usuario y luego puede admitir la generación de notas posteriores a la reunión.

En este flujo, la transcripción se basa específicamente en el audio de la reunión de Zoom asociado con esa sesión de la reunión. No se basa en audio local del dispositivo no relacionado fuera de la reunión en sí. Después de que la reunión concluye, la transcripción y las notas resultantes pueden permanecer Disponible de acuerdo con la Configuración de retención aplicable del usuario, mientras que el audio subyacente utilizado para la transcripción no se conserva una vez que el procesamiento se completa.

### Mis notas fuera de Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/2cdff7ddfa928528c33fb3b8513cc046b661463d" alt=""><figcaption><p>Resumen de los flujos de datos de My Notes fuera de las reuniones de Zoom</p></figcaption></figure></div>

El diagrama anterior muestra cómo, fuera de Zoom Meetings, My Notes funciona a través del audio del dispositivo local del usuario en lugar de a través de una sesión compartida de reunión de Zoom. Si está habilitado durante una reunión de terceros o una discusión en persona, My Notes puede usar el Acceso a nivel del sistema operativo al micrófono del usuario y, cuando corresponda, al audio del sistema para capturar el audio local del dispositivo disponible en ese Dispositivo. Luego, este audio se enruta a través de una sesión MMR de un solo usuario y se procesa mediante el servicio de reconocimiento automático del habla (ASR) de Zoom para generar una transcripción, que se entrega al Dispositivo del usuario y puede posteriormente respaldar la generación de notas posteriores a la reunión.

Esto significa que, fuera de Zoom Meetings, la transcripción se basa exclusivamente en el audio transmitido desde el Dispositivo local del usuario y no en una transmisión compartida de audio de reunión de Zoom. My Notes también puede pedir al usuario que comience una nueva nota cuando se detecta actividad del micrófono del Dispositivo, lo que ayuda a mostrar las Características en situaciones como reuniones de terceros, grabaciones basadas en navegador u otros flujos de trabajo con micrófono activo. Al igual que en el flujo dentro de la reunión, el audio usado para la transcripción no se conserva una vez que la transcripción se completa, mientras que las notas y transcripciones resultantes pueden permanecer guardadas en la cuenta del usuario según la Configuración de retención aplicable.

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/86bb0cd943d3756232faef4c84342e2a729f6ea6" alt=""><figcaption><p>Resumen de los flujos de datos de ZoomMate</p></figcaption></figure></div>

El diagrama anterior ilustra cómo **ZoomMate funciona como una superficie de trabajo principal dentro de Zoom Workplace**, operando en el punto en que se reúnen el contexto del usuario, el conocimiento conectado y las capacidades de ejecución. En lugar de existir solo como un asistente independiente, ZoomMate se sitúa en el centro de un entorno de trabajo más amplio en el que los usuarios pueden buscar, razonar, crear y actuar en los materiales y sistemas que respaldan su trabajo diario.

Una parte importante de este rol proviene del Acceso de ZoomMate a **contenido propio de Zoom**. Esto puede incluir elementos como resúmenes, My Notes, grabaciones, documentos de Canvas, mensajes de chat y otros materiales generados por el usuario creados en toda la plataforma de Zoom. Estos elementos ayudan a proporcionar a ZoomMate el contexto que necesita para responder preguntas, sintetizar información, generar resultados y dar seguimiento. ZoomMate también puede usar **memoria**, lo que le permite incorporar las preferencias relevantes del usuario o detalles relacionados con el trabajo al ayudar a completar una tarea.

El diagrama también muestra cómo ZoomMate se extiende más allá del contenido nativo de Zoom al integrarse con **fuentes de conocimiento de terceros**. Por ejemplo, los servicios conectados de Almacenamiento en la nube como Google Drive o OneDrive pueden servir como repositorios externos de información accesible para el usuario. Cuando estas fuentes se integran, Zoom puede indexar contenido aprobado para apoyar la recuperación entre esos materiales, lo que permite a ZoomMate usar **búsqueda agentiva** para trabajar tanto con el contenido de Zoom como con el conocimiento conectado de terceros. De esta manera, ZoomMate puede buscar no solo entre lo que existe dentro de Zoom, sino también entre los documentos y materiales a los que un usuario está autorizado a acceder en plataformas externas conectadas.

Otras fuentes de datos personales, como **correo electrónico y calendario** (excepto los correos electrónicos cifrados de extremo a extremo), también pueden respaldar ZoomMate, pero funcionan de manera diferente. En lugar de ser indexadas, estas fuentes generalmente se comunican con ZoomMate mediante recuperación directa basada en API. Esto las hace útiles para tareas como localizar contexto relevante del correo electrónico, revisar información del calendario o ayudar a Programar eventos, sin tratarlas como parte de la capa de recuperación indexada utilizada para una búsqueda de documento más amplia.

El diagrama también refleja que ZoomMate puede conectarse con una gama más amplia de **servicios y conectores de terceros** que respaldan la toma de acciones así como el acceso al conocimiento. Estos pueden incluir sistemas como Jira, HubSpot, ServiceNow, Workday y otras plataformas comerciales conectadas. A través de estas conexiones, ZoomMate puede realizar **tareas agénticas** en nombre del usuario, como crear o actualizar registros, recuperar información de servicios externos o llevar a cabo otras acciones conectadas dentro de esos sistemas. Esto hace que ZoomMate sea más que una superficie de recuperación y síntesis; también funciona como una capa de ejecución que puede ayudar a convertir el contexto en acción.

Esta misma base también ayuda a impulsar **agentes** y **flujos de trabajo** dentro del entorno de ZoomMate. Los agentes pueden usar el mismo contexto subyacente, las mismas rutas de recuperación y los mismos sistemas conectados para ofrecer una asistencia más dinámica basada en razonamiento, ayudando a los usuarios a llevar a cabo tareas más amplias de varios pasos con mayor continuidad y adaptabilidad. Los flujos de trabajo, en cambio, pueden proporcionar una automatización más estructurada y repetible, permitiendo a los usuarios definir procesos recurrentes que operan en el contenido de Zoom y, cuando se admite, en sistemas externos conectados. De esta manera, ZoomMate no solo sirve como una interfaz conversacional, sino también como un punto de orquestación tanto para la actividad agéntica dinámica como para una automatización más estructurada.

**Sandbox** también puede admitir algunas de las capacidades de ejecución más avanzadas de ZoomMate. Para tareas que requieren ejecución de código, generación de archivos, automatización u otro procesamiento más sofisticado, ZoomMate puede usar un entorno sandbox separado en lugar de depender únicamente del procesamiento conversacional estándar. Este sandbox se ejecuta en la infraestructura AWS de Zoom y proporciona una capa de ejecución aislada y de corta duración para tareas de mayor complejidad, ayudando a ZoomMate a llevar a cabo ciertas operaciones en un entorno más controlado. De esta manera, la misma base más amplia de ZoomMate que admite la recuperación, el razonamiento, los agentes y los flujos de trabajo también puede admitir una ejecución de tareas más avanzada cuando el trabajo solicitado lo requiere.

Por último, el diagrama no muestra todos los componentes subyacentes que ayudan a impulsar ZoomMate. No muestra explícitamente capas de capacidades fundamentales como las habilidades, ni otras estructuras de soporte que forman parte de la infraestructura y el diseño más amplios de Zoom AI. Se supone que esos elementos operan dentro del sistema de IA subyacente que permite el comportamiento de ZoomMate. En cambio, el propósito de este diagrama es mostrar los principales contextos, conocimientos y superficies de acción a través de los cuales ZoomMate funciona como una superficie de trabajo unificada en Zoom y en los sistemas conectados.

### Conexiones e indexación de terceros de ZoomMate

<figure><img src="/files/d3c717fcc7d0d9d23c77aa6b35316a4f2cca9fe1" alt="" width="375"><figcaption><p>Descripción general de cómo ZoomMate se conecta a conexiones de terceros y fuentes de datos</p></figcaption></figure>

El diagrama anterior ilustra dos partes relacionadas pero distintas de la arquitectura de datos de terceros de ZoomMate. La primera es cómo ZoomMate se conecta a aplicaciones y servicios de terceros compatibles para poder recuperar información o realizar acciones dentro de esos sistemas. La segunda es cómo ciertas fuentes de contenido de terceros compatibles pueden ingerirse e indexarse para que ZoomMate pueda recuperar posteriormente ese contenido de forma más eficiente mediante generación aumentada por recuperación.

#### <mark style="color:azul;">ZoomMate puede conectarse directamente a aplicaciones y servicios de terceros</mark>

Una parte del diagrama muestra cómo ZoomMate se conecta a aplicaciones de terceros compatibles, como Jira, Confluence, Salesforce, ServiceNow, Workday, plataformas de Almacenamiento en la nube y otros sistemas Comerciales externos. Estas conexiones permiten a ZoomMate operar más allá del contenido nativo de Zoom al interactuar con herramientas que almacenan datos Comerciales o respaldan el trabajo operativo fuera de la plataforma Zoom.

Estas conexiones se establecen sobre una conexión TLS a través de modelos de Acceso autorizados, como integraciones basadas en API o conexiones basadas en MCP. En cualquiera de los casos, ZoomMate opera dentro de los Permisos concedidos por el servicio conectado. Esto permite a ZoomMate recuperar información relevante de esos sistemas y, cuando se admita, realizar acciones en ellos en nombre del usuario. Por ejemplo, ZoomMate puede recuperar detalles de un problema de Jira, buscar una página de Confluence, actualizar un grabar en ServiceNow o usar otro sistema conectado como parte de la ejecución de una tarea más amplia.

Este modelo de conexión directa es especialmente importante para tareas que dependen del estado actual del sistema o del Acceso en vivo a herramientas de terceros. En esos casos, ZoomMate puede usar la aplicación conectada como un punto de conexión de servicio activo en lugar de solo como un repositorio de contenido previamente indexado.

#### <mark style="color:azul;">ZoomMate puede indexar contenido de terceros aprobado para su recuperación posterior</mark>

Una segunda parte del diagrama muestra cómo ZoomMate puede ingerir e indexar contenido de fuentes de terceros compatibles para que el material pueda recuperarse posteriormente como parte de una búsqueda o de una respuesta asistida por IA. Este modelo de recuperación indexada es más relevante para repositorios de contenido conectados como sistemas de Almacenamiento en la nube, bases de conocimiento, plataformas de documento y otras fuentes compatibles donde ZoomMate puede necesitar buscar en un cuerpo mayor de contenido externo retenido.

Una vez que una fuente compatible se conecta y se aprueba para la indexación, ZoomMate puede recuperar contenido de esa fuente y prepararlo para búsquedas posteriores. Este proceso de preparación puede incluir dividir archivos o registros más grandes en unidades más pequeñas y grabar metadatos como información de origen, hora de actualización, propiedad e información de Permiso. Ese contenido se escribe entonces en la capa de indexación de Zoom para que luego pueda buscarse mediante coincidencia exacta y recuperación basada en el significado.

Cuando un usuario envía una solicitud que depende de contenido indexado de terceros, ZoomMate puede buscar ese material indexado, evaluar qué resultados son más relevantes y aplicar la información de Permiso asociada con la fuente original para que solo el contenido autorizado sea elegible para aparecer. Luego, el contenido autorizado más relevante puede pasarse a la capa de IA de ZoomMate como contexto de apoyo para la respuesta. De este modo, el diagrama muestra cómo el contenido indexado de terceros puede ayudar a ZoomMate a producir respuestas basadas en materiales empresariales conectados reales en lugar de confiar solo en el conocimiento general del modelo.

## Avatares personalizados

### Creación de avatar

<div data-with-frame="true"><figure><img src="/files/d1ce425fe89f4f427be9ca91e95896139bcbfbbb" alt=""><figcaption><p>Descripción general del proceso de creación de un avatar personalizado</p></figcaption></figure></div>

El diagrama anterior ilustra cómo se crea un avatar personalizado a partir de un video y una voz grabados por un usuario. El proceso comienza cuando se muestra al usuario un guion y se le pide que grabe leyendo ese guion. Este paso de grabación guiada sirve para Permitir que Zoom capture el material audiovisual necesario para generar tanto la apariencia del avatar del usuario como el modelo de voz asociado que se usa en futuras salidas basadas en avatar.

Después de que el usuario completa la grabación, los componentes de audio y video se procesan por rutas distintas. El audio se envía a un servicio de terceros que genera una semejanza de voz basada en el habla grabada del usuario. Una vez que ese procesamiento se completa, el servicio de terceros devuelve a Zoom un identificador único de voz. Zoom almacena este identificador como la referencia de voz del usuario para poder usarlo más adelante al generar clips basados en avatar u otras salidas compatibles que dependen de esa voz sintetizada.

Al mismo tiempo, el componente de video se envía a un módulo de generación de avatar alojado por Zoom, donde Zoom procesa el material visual grabado para crear la representación de avatar del usuario. Esto da como resultado una plantilla de avatar que Zoom almacena para uso futuro. En conjunto, estas dos salidas retenidas —el identificador de voz almacenado y la plantilla de avatar almacenada— permiten a Zoom generar futuros clips o medios basados en avatar que reflejan tanto la apariencia del usuario como su voz sintetizada.

### Creación de clip

<div data-with-frame="true"><figure><img src="/files/6a4e94cf66541a685464af923e76094cf11c9212" alt=""><figcaption><p>Descripción general del proceso de creación de clip de Avatar personalizado</p></figcaption></figure></div>

El diagrama anterior ilustra cómo se crea un clip de avatar personalizado a partir del avatar almacenado y el perfil de voz sintetizada de un usuario. El proceso comienza cuando el usuario carga el guion que quiere que el avatar presente. Ese guion sirve como contenido de origen para el clip generado.\
\
A partir de ahí, el backend web de Zoom coordina dos entradas paralelas necesarias para crear la salida final. Primero, envía el identificador de voz almacenado del usuario junto con el guion al servicio de generación de voz de terceros, que produce el audio del clip usando la voz sintetizada del usuario. Segundo, envía la plantilla de avatar almacenada del usuario al módulo de generación de avatar de Zoom para que el componente visual del clip pueda prepararse usando la apariencia del avatar creada previamente por el usuario.\
\
Una vez que el servicio de generación de voz de terceros ha producido el audio, ese audio se devuelve a Zoom y se pasa al módulo de generación de avatar. El módulo de generación de avatar combina entonces la plantilla de avatar almacenada con el audio de voz generado, sincronizando los movimientos faciales y de la boca del avatar con el contenido hablado. Después de que este proceso de sincronización labial y renderizado se completa, Zoom produce el clip de avatar terminado y se lo entrega al usuario.

## Diccionario personalizado

<div data-with-frame="true"><figure><img src="/files/4c804279d387ca7eafd6f446461330548b16c6c4" alt=""><figcaption><p>Flujos de datos del Diccionario personalizado</p></figcaption></figure></div>

El diagrama anterior ilustra cómo las Características del Diccionario personalizado ayudan a mejorar la precisión de las salidas de Zoom basadas en voz al proporcionar al servicio de Reconocimiento Automático del Habla (ASR) de Zoom contexto de vocabulario adicional. Estas Características están diseñadas para admitir palabras, abreviaturas, jerga, nombres de productos o terminología especializada que pueden ser específicos de una empresa, sector, equipo o región y que podrían no reconocerse o representarse correctamente durante la transcripción.

El proceso comienza cuando un administrador de cuenta crea y almacena un diccionario personalizado en el portal web de Zoom. Ese diccionario contiene la lista de palabras o frases aprobadas que la Organización quiere que Zoom reconozca con mayor precisión. Una vez que el diccionario se ha guardado a nivel de cuenta, queda Disponible para su uso en contextos compatibles de reunión y procesamiento de habla.

Cuando un usuario inicia más tarde una reunión, el servicio ASR de Zoom puede recibir el diccionario personalizado de la cuenta como parte de su contexto de procesamiento. A medida que el servicio ASR convierte el audio en vivo en datos de voz a texto, puede comparar el lenguaje hablado percibido con el diccionario personalizado e intentar mapear los sonidos reconocidos a los términos almacenados. Esto proporciona al ASR orientación adicional sobre qué palabras buscar, cómo pueden escribirse ciertos términos y cómo deben interpretarse las abreviaturas o el lenguaje especializado.

El resultado es que la salida inicial de voz a texto puede reflejar con mayor precisión la terminología realmente utilizada en la reunión. Esa mayor precisión puede trasladarse luego a los artefactos derivados de la conversación. Por ejemplo, si más tarde se genera un resumen de la reunión, subtítulos, una transcripción o cualquier otro activo basado en datos de voz a texto, esas salidas pueden reflejar una representación más precisa de las palabras pronunciadas durante la reunión, lo que ayuda a mejorar la calidad y la utilidad del artefacto generado por IA resultante.

## Plantillas personalizadas de resumen de la reunión

<div data-with-frame="true"><figure><img src="/files/5bcff02f620b3f3d5e751640b6ee0a1d8b2d1e2f" alt=""><figcaption><p>Flujos de datos de las plantillas personalizadas de resumen de la reunión</p></figcaption></figure></div>

El diagrama anterior ilustra cómo se generan los resúmenes personalizados de la reunión a partir de una plantilla definida por el usuario o por la cuenta. El proceso comienza cuando se crea y guarda una plantilla en Zoom. A nivel de cuenta, un administrador puede definir una plantilla personalizada de resumen de la reunión para uso de la organización. A nivel individual, un usuario puede crear una plantilla personal de resumen de la reunión según sus propias preferencias. Una vez creada, la plantilla seleccionada se almacena para poder aplicarse durante la generación posterior del resumen.

Al concluir una reunión, Zoom AI puede usar los datos de voz a texto de la reunión para generar un resumen que siga la estructura y el énfasis de la plantilla personalizada elegida. Si la plantilla personalizada se seleccionó antes de que se generara el resumen de la reunión, Zoom AI aplica esa plantilla directamente al producir el resumen. Esto permite que la salida resultante refleje el formato, las secciones o las prioridades específicas definidas en la plantilla en lugar de una estructura de resumen predeterminada.

Si no se seleccionó una plantilla personalizada antes de que el resumen se generara por primera vez, Zoom solo puede aplicar esa plantilla más tarde si se conservó la transcripción de la reunión. En ese caso, Zoom AI puede volver a procesar la transcripción conservada usando la configuración de la plantilla y producir un nuevo resumen alineado con esa estructura. Sin embargo, si no se conservó la transcripción, Zoom no dispone de la transcripción subyacente para volver a procesarla, lo que significa que la plantilla personalizada no puede aplicarse después.

## Aislamiento de audio personal

<div data-with-frame="true"><figure><img src="/files/6b8c8ef4334abb03ab4276f3aad02def8a0c2e5b" alt=""><figcaption><p>Descripción general de cómo el Aislamiento de audio personal aísla la voz de un usuario</p></figcaption></figure></div>

El diagrama anterior ilustra cómo **Aislamiento de audio personal** funciona usando una huella de voz almacenada localmente en el Dispositivo del usuario para distinguir el habla del usuario del Ruido de fondo circundante. El proceso comienza cuando el usuario graba una muestra de voz a través de las Características de Aislamiento de audio personal en la aplicación Zoom Workplace. Esa grabación se usa para crear una huella de voz local que ayuda a la aplicación a reconocer las características de la voz del usuario. Esta huella de voz permanece en la máquina local y no se transmite a la nube de Zoom.

Cuando el usuario habla más tarde durante una reunión en un entorno con ruido ambiental, la aplicación Zoom Workplace usa esa huella de voz almacenada localmente para ayudar a identificar los patrones de habla del usuario y separarlos de los sonidos circundantes. Esto permite a la aplicación Reducir el ruido de fondo y aislar la voz del usuario con mayor eficacia antes de que el audio se envíe más adelante a través del flujo de la reunión.

Como resultado, el audio transmitido a la nube de Zoom es el audio de la reunión refinado con el Ruido de fondo ambiental filtrado en la medida en que estas Características lo permiten. La huella de voz subyacente del usuario no se envía a la infraestructura en la nube de Zoom. De este modo, Aislamiento de audio personal funciona como Características de procesamiento a nivel de Dispositivo local que mejora la claridad del audio antes de que el audio limpio se transmita a la sesión en vivo de Zoom.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/es/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
