> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/sv/ai/ai-whitepaper/diagrams.md).

# Diagram och dataflöden

Zoom AI-funktioner omfattar ett brett utbud av produkter, tjänster och arbetsflöden, vilket innebär att inget enskilt diagram rimligen eller fullständigt kan beskriva hur AI fungerar på hela Zoom plattform. Olika funktioner förlitar sig på olika indata, bearbetningsvägar, lagringsbeteenden, modellinteraktioner och utdata. Vissa fungerar endast med direkt, tillfällig data under en aktiv interaktion, medan andra skapar bevarade artefakter som senare kan stödja ytterligare funktioner. Vissa funktioner förblir helt inom Zooms förstapartsmiljö, medan andra förlitar sig på Zooms federerade AI-arkitektur och, i vissa fall, anslutna externa system. För att göra detta dynamiska och omfattande system lättare att förstå presenterar denna sida en serie diagram i stället för att förlita sig på en enda visuell modell. Varje diagram lyfter fram ett annat lager, en annan väg eller ett annat funktionsmönster inom den bredare Zoom AI-plattformen. Längst ned i dessa avsnitt finns tabeller som beskriver vilka funktioner som är tillämpliga, tillhörande produkt och status för artefaktbevarande. Senare avsnitt granskar sedan vissa skräddarsydda produktfunktioner var för sig och erbjuder mer fokuserade förklaringar av hur dessa specifika funktioner fungerar.

Sekvensen börjar nedan med en förenklad översikt över Zoom AI i dess mest grundläggande form och visar plattformen i ett förstapartscentrerat tillstånd som använder Zooms standard federerade modellarkitektur, men som ännu inte introducerar affärsintegreringar från tredje part eller externa kunddatakällor utöver Zooms tredjepartsleverantörer av AI-modeller. Därifrån introducerar diagrammen gradvis mer specialiserade delar av plattformen, inklusive Zooms AI-alternativ, omvandlingen av direktsänt ljud till artefakter som AI kan använda och de sätt på vilka dessa artefakter senare kan stödja andra funktioner och arbetsflöden. Sammantaget är dessa diagram avsedda att göra ett mycket komplext system mer lättillgängligt genom att dela upp det i mindre, lättare att följa vyer som återspeglar hur olika delar av Zooms AI-plattform fungerar i praktiken.

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/92a42e0964ff932f8639bd2bb4871be2e867751b" alt=""><figcaption><p>En enkel översikt över Zoom AI</p></figcaption></figure></div>

Diagrammet ovan presenterar Zooms AI-plattform i förenklad form och visar plattformen i ett av dess mest grundläggande tillstånd. Det illustrerar hur olika delar av Zooms bredare produkt- och tjänstearkitektur, som kallas Zoom Web-backend – inklusive områden som möten, Phone, Kontaktcenter, automatisk taligenkänning och andra Zoom-erbjudanden – matas in i den större Zoom-plattformen och bidrar till mängden användartillgängligt innehåll som kan stödja efterföljande AI-funktioner.

Ett centralt begrepp i detta diagram är **Zoom användarinnehåll**. Detta avser innehållet som skapas genom en användares interaktioner med Zoom-produkter och -tjänster och som senare kan fungera som indata, kontext eller artefakter för AI-drivna upplevelser. Beroende på den berörda produkten och funktionen kan detta omfatta material som Zoom chatt-meddelanden, mötessammanfattningar, avskrifter, Canvas-dokument, My Notes, inspelningar och andra liknande användarorienterade artefakter. Detta material utgör en viktig del av det kontextuella lager som kan stödja senare AI-assisterad hämtning, resonemang, sammanfattning och uppföljning.

En del av detta innehåll kan också förberedas för framtida AI-användning genom hämtningsinfrastruktur, såsom indexerad hämtning eller moduler för hämtningsutökad generering. I dessa fall kan relevanta artefakter matas in och indexeras så att de mer effektivt kan lokaliseras och användas i senare AI-frågor eller processer. Detta hjälper Zoom AI att arbeta inte bara med direkta interaktioner utan även med bevarad kontext och tidigare användargenererat material på hela plattformen.

Slutligen introducerar diagrammet också **Zoom AI** sig självt som det gemensamma AI-lagret som fungerar i hela detta bredare ekosystem. I denna förenklade vy visas Zoom AI genom Zooms standard federerade metod, där Zoom kan använda både Zoom-hostade modeller som körs i Zooms egen infrastruktur och utvalda tredjepartsleverantörer av AI-modeller när det är lämpligt för den aktuella uppgiften. Denna federerade modell gör det möjligt för Zoom att dirigera AI-uppgifter genom den mest lämpliga tillgängliga modellmiljön samtidigt som en enhetlig AI-upplevelse upprätthålls på hela plattformen.

## Metoder för Zoom AI-tjänstemodeller

<div data-with-frame="true"><figure><img src="/files/640385f069f1c197a424af47ea9685017c8d2bec" alt=""><figcaption><p>Översikt över Zooms AI-metoder, inklusive Federated, ZM+ och ZMO</p></figcaption></figure></div>

Diagrammet ovan illustrerar Zooms tre AI-metoder: Federated Approach, Zoom-Hosted Models Plus (ZM+) och Endast Zoom-hostade modeller (ZMO). Tillsammans representerar dessa de tre främsta sätten som Zoom tillhandahåller AI-tjänster till kunder på, där vart och ett erbjuder en olika balans mellan funktionernas bredd, modellflexibilitet och datakontroll.

Federated Approach är Zooms standardmetod och den mest funktionskompletta metoden. Den gör det möjligt för Zoom att arbeta med flera AI-leverantörer, inklusive Zoom-hostade modeller och utvalda tredjepartspartner för modeller, så att uppgifter kan dirigeras till den modell som är bäst lämpad för begäran. ZM+ tillhandahåller en mer kontrollerad distributionsmodell genom att använda dedikerade modellinstanser som hanteras av Zoom, medan ZMO håller AI-bearbetningen enbart inom Zoom-hostade modeller och erbjuder den mest restriktiva och kontrollerade modellvägen, men med en mer begränsad uppsättning funktioner.

För denna sida illustrerar de efterföljande diagrammen generellt den federerade metoden, eftersom den återspeglar Zooms standardmetod och den bredaste vyn av Zoom AI-funktionalitet. Organisationer som använder ZM+ eller ZMO kan ofta tolka samma diagram genom att mentalt ta bort tredjepartsleverantörerna av AI-modeller och fokusera på de återstående delar av flödet som hanteras av Zoom.

Se sidan Zoom AI Models, Processing, Storage, and Usage för mer information.

## Direktmediefunktioner och artefakter

<div data-with-frame="true"><figure><img src="/files/801d0b7d9a8e2619161654ff07fe6970dc64c054" alt=""><figcaption><p>Översikt över hur direkta medier omvandlas till tal-till-text-data som driver Zoom AI-funktioner</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur direkta medieinteraktioner – såsom möten och telefonsamtal – kan skapa efterföljande AI-drivna funktioner och artefakter på Zoom-plattformen. I varje fall kommer direkt ljud in i Zoom via anslutningspunkten som är kopplad till den produkten eller tjänsten. För möten är detta vanligtvis **Multimedia Router (MMR)**. För telefoni kommer ljud vanligtvis in via **SIP-zoner**.

När ljudet har matats in dirigeras det till Zooms **Automatic Speech Recognition (ASR)** -tjänst, som omvandlar direkt ljud till **tal-till-text-data**. Den tal-till-text-datan kan användas på flera sätt beroende på vilka inställningar och funktioner som är aktiverade. I vissa fall levereras den omedelbart till användare som **direkta undertexter**. I sammanhang som stöds kan den också skickas till Zooms **Live Translation** -tjänst, som översätter tal-till-text-resultatet till översatta undertexter för deltagare som använder andra språk.

Tal-till-text-data kan också stödja mer beständiga eller härledda funktioner. Om **transkription** är aktiverad, eller om en användare använder **My Notes**, kan ASR-tjänsten skapa en avskrift efter att den direkta sessionen har avslutats. Om bevarande av avskrift inte är aktiverat bevaras dock inte tal-till-text-datan som användes under interaktionen som en beständig avskrift. Även i dessa fall kan Zoom AI fortfarande använda tal-till-text-datan tillfälligt under sessionen för att stödja direkta AI-funktioner.

En användare kan till exempel ställa **frågor under möte** via Zoom AI under ett möte. I så fall kan Zoom AI använda direkta tal-till-text-data från mötet för att tolka användarens fråga och generera ett relevant svar grundat i det pågående samtalet.

En viktig skillnad i detta flöde är att Zoom AI inte nödvändigtvis bevarar en avskrift av samtalet enbart för att tal-till-text-data användes under sessionen. Om inte bevarande av avskrift uttryckligen är aktiverat, eller om datan bevaras genom en funktion som **My Notes**, kan tal-till-text-datan i sig förbli tillfällig. Samtidigt kan vissa efterföljande artefakter som skapas från den datan bestå. Om en användare till exempel ställer frågor under ett möte kan den resulterande AI-konversationen eller relaterade anteckningar senare förbli tillgängliga som en bevarad artefakt även när en beständig avskrift inte skapas.

Vissa bevarade artefakter kan också bli grunden för ytterligare efterföljande artefakter och arbetsflöden. En mötessammanfattning, webbinariumsammanfattning, samtalssammanfattning eller en användares My Notes kan omvandlas till ett **Zoom Canvas** -dokument, där det kan fortsätta att redigeras, utökas och användas som en arbetsartefakt. I sin tur kan de resulterande dokumenten senare fungera som kontext för andra AI-funktioner eller arbetsflöden som diskuteras på andra ställen i detta dokument. På så sätt kan direkt ljud leda inte bara till omedelbara AI-funktioner utan också till en kedja av bevarade artefakter som fortsätter att stödja senare AI-assisterat arbete på hela Zoom-plattformen.

Detta diagram är tillämpligt på följande funktioner:

|           Funktioner          |                                             Beskrivning                                             |     Produkt(er)    | Bevarande av artefakter |
| :---------------------------: | :-------------------------------------------------------------------------------------------------: | :----------------: | :---------------------: |
|      Direkta undertexter      |                      Tal-till-text-undertexter i realtid för direkta sessioner.                     | Möten, webbinarier |        Ej sparad        |
|     översatta undertexter     |               I realtid genererade översatta undertexter från live tal-till-text-data.              | Möten, webbinarier |        Ej sparad        |
|           Avskrifter          |                     Sparade textposter av tal-till-text-innehåll från ett möte.                     |   möten, telefon   |          Sparad         |
|      Mötessammanfattning      | AI-genererad sammanfattning av viktiga diskussionspunkter, beslut och åtgärdspunkter från ett möte. |      Meetings      |          Sparad         |
| Sammanfattning av webbinarium |     AI-genererad sammanfattning av viktigt innehåll från webbinarium som delas efter en session.    |     Webbinarium    |          Sparad         |
|     Samtalssammanfattning     |           AI-genererad sammanfattning efter samtal av viktiga detaljer och åtgärdspunkter.          |       Telefon      |          Sparad         |
|            My Notes           | Personliga anteckningar, avskrift och kontext från möte sparas för senare referens och uppföljning. |      Meetings      |          Sparad         |
|     Uppföljningsuppgifter     |                   AI-föreslagna uppföljningsåtgärder baserade på samtalsdetaljer.                   |     Zoom Tasks     |          Sparad         |
|  Prioritering av röstbrevlåda |          AI-baserad rangordning av röstmeddelanden efter viktighet definierad av användare.         |       Telefon      |          Sparad         |
|          Mötesfrågor          |                     AI-svar på frågor i möte med hjälp av livekontext från möte.                    |      Meetings      |          Sparad         |
|      Frågor i webbinarium     |              AI-svar på frågor i webbinarium med hjälp av livekontext från webbinarium.             |     Webbinarium    |          Sparad         |
|         Samtalsfrågor         |                   AI-svar på frågor i samtal med hjälp av livekontext från samtal.                  |       Telefon      |          Sparad         |

## Inspelningsfunktioner

<div data-with-frame="true"><figure><img src="/files/03c7fe3be26efe20093f941fcb253966852ec167" alt=""><figcaption><p>Översikt över hur Zoom bearbetar inspelningar och AI-funktioner</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur Zoom AI stöder **inspelningsbaserade AI-funktioner** genom att arbeta på den färdiga inspelningen efter att live session har avslutats. Liksom med andra ljudbaserade Zoom-upplevelser kommer det ursprungliga mediet in via den infrastruktur som är kopplad till den produkt som används—såsom **MMR** för möten eller den relevanta **SIP-zonen** för telefoni. Som en del av det flödet skapas inspelningen och skickas till Zooms inspelningstjänst, där den färdiga inspelningen sedan lagras i Zooms innehållslagring.

När inspelningen har slutförts skickas ljudet som är kopplat till den inspelningen till Zooms **Automatic Speech Recognition (ASR)** tjänst för transkription. Denna process genererar en **inspelningsspecifik avskrift**, vilket kan skilja sig från tal-till-text-data som genereras under själva sessionen. Med andra ord genereras avskriften som hör till en avslutad inspelning som en del av efterbearbetningsflödet efter inspelningen, i stället för att bara kopieras från lagret för liveinteraktionen.

När inspelningsavskriften har skapats kan den sedan skickas till **Zoom AI** för ytterligare analys. I detta steg bearbetar Zoom AI avskriften för att identifiera inspelningsartefakter på högre nivå, såsom sammanfattningar, höjdpunkter, kapitel och andra strukturerade representationer av konversationen. Denna analys utförs med hjälp av Zooms AI-bearbetningslager, inklusive Zoom-hostade modeller där så är tillämpligt, för att omvandla den råa inspelningsavskriften till mer användbara utdata efter mötet eller efter samtalet.

När analysen är klar kopplas de resulterande AI-genererade artefakterna till själva inspelningen. Det är detta som gör att användare som visar en inspelning inte bara ser inspelningen och avskriften, utan också de extra AI-genererade lagren som gör innehållet lättare att navigera i och förstå. På så sätt visar diagrammet hur en avslutad inspelning kan bli grunden för ett andra steg i AI-bearbetningen, som producerar berikade inspelningsfunktioner som sträcker sig bortom det ursprungliga lagrade mediet.

Detta diagram är tillämpligt på följande funktioner:

|                    Funktioner                    |                                                                    Beskrivning                                                                   | Produkt(er) | Bevarande av artefakter |
| :----------------------------------------------: | :----------------------------------------------------------------------------------------------------------------------------------------------: | :---------: | :---------------------: |
|                 smart inspelning                 |                                    AI-genererade höjdpunkter, kapitel och sammanfattningar för inspelade möten                                   |   Meetings  |          Sparad         |
|     Generera titlar, beskrivningar och taggar    |                                             AI-genererade titlar, beskrivningar och taggar för klipp.                                            |    Klipp    |          Sparad         |
| AI-innehållsskapande för inspelningar och videor | Använder avskrifter av evenemangsinspelningar för att generera skriftligt innehåll och AI-utvalda videoklipp från viktiga ögonblick i sessionen. | Zoom Events |          Sparad         |

## Härledda AI-funktioner

<div data-with-frame="true"><figure><img src="/files/ddc8e3522234f9fd3a763530a37180cb780bc2a4" alt=""><figcaption><p>Översikt över hur Zoom hanterar funktioner för generering av härlett AI-innehåll</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **deriverade AI-funktioner** operera genom att använda tillgänglig användardata för användare som kontext för senare AI-assisterade uppgifter och resultat. I dessa fall arbetar Zoom AI inte längre bara utifrån data från direkta interaktioner. I stället hämtar den från artefakter som redan finns i användarens bredare innehållsmiljö för att besvara en fråga, sammanfatta information eller hjälpa till att ta fram ett nytt resultat.

Beroende på uppgiften kan detta sammanhangsmaterial inkludera artefakter som chattmeddelanden, mötesöversikter, Mina anteckningar, transkriberingar, Zoom Canvas-dokument, Zoom Slide decks, Zoom Paper-dokument, Zoom Mail eller Zoom Calendar-innehåll, ansluten tredjeparts e-post- eller kalenderdata eller filer som användaren har laddat upp för att stödja en viss begäran. På så sätt använder Zoom AI tidigare skapade Zoom-artefakter, tillsammans med integrerad data på individnivå där sådan finns tillgänglig, för att hjälpa till att uppnå det slutresultat som en användare har begärt.

Diagrammet återspeglar också att denna process i sig kan generera **innehåll för nya användare**. Till exempel kan Zoom AI använda befintligt material för att skapa ett nytt Zoom Sheet, Zoom Canvas-dokument, Zoom Slide-presentation eller Zoom Paper-dokument. När de väl har skapats blir dessa nya artefakter en del av en användares bredare innehållsarkiv och kan senare användas igen som kontext för framtida AI-assisterade funktioner och arbetsflöden. Detta skapar en skiktad utveckling där tidigare innehåll från användare kan stödja senare resultat, och dessa resultat kan i sin tur med tiden bli nya kontextuella artefakter.

Samma mönster kan även förekomma i andra Zoom-gränssnitt. I miljöer som **Zoom hubb** eller **AI-chattpanel**, användare kan ställa frågor över plattformen eller interagera med dokument och material som är tillgängliga via Zooms AI-produktivitetssvit. I dessa fall arbetar Zoom AI återigen utifrån befintliga användartillgängliga artefakter för att tillhandahålla hämtning, sammanställning, frågesvar eller uppföljning, vilket visar hur derivativa AI-funktioner utökar värdet av tidigare innehåll till nya uppgifter och resultat.

{% hint style="info" %}
**Notering**

Lokala uppladdningar av användarfiler [kan inaktiveras](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

Detta diagram är tillämpligt på följande funktioner:

|      Funktioner     |                                                                                     Beskrivning                                                                                    |              Produkt(er)             | Bevarande av artefakter |
| :-----------------: | :--------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :----------------------------------: | :---------------------: |
| Innehållsgenerering | Innehållsgenerering använder AI för att skapa, förfina, sammanfatta och organisera dokument, presentationer, kalkylblad och andra resultat utifrån uppmaningar på naturligt språk. | Canvas, kalkylblad, papper, bildspel |          Sparad         |
|    AI-chattpanel    |                              Konversationsbaserad AI-assistans för att ställa frågor, generera innehåll och arbeta i den tillgängliga Zoom-kontexten.                              |             AI-chattpanel            |          Sparad         |
|     Ställ frågor    |                                                       AI-genererade svar baserade på valda dokument och material i Zoom hubb.                                                      |                 hubb                 |          Sparad         |

## Generativa och kompositionsfunktioner

<div data-with-frame="true"><figure><img src="/files/167a9314dad8dcaf2909b03485fbc64898852614" alt=""><figcaption><p>Översikt över hur Zoom bearbetar generativa och kompositions-AI-begäranden</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **generativa och kompositionsfunktioner** fungerar inom Zoom AI-plattformen. Till skillnad från derivativa AI-funktioner, som förlitar sig på redan befintligt användarinnehåll för att hjälpa till att nå en senare uppgift eller ett senare resultat, drivs generativa och kompositionsfunktioner ofta mer direkt av användarens omedelbara inmatning. I många fall är dessa funktioner inte beroende av bevarade Zoom-artefakter som redan lagras någon annanstans i användarens innehållsmiljö. I stället drivs de främst av direkta användaruppmaningar, frågor, uppladdade filer eller det omedelbara skärminnehåll som är kopplat till den aktiva produktupplevelsen.

Denna skillnad är särskilt viktig för funktioner som arbetar utifrån innehåll som är synligt i användarens aktuella kontext snarare än från tidigare indexerade eller bevarade artefakter. Till exempel, när en användare sammanfattar en chattråd, sammanfattar ett e-postmeddelande eller ber Zoom AI att utarbeta ett svar på ett e-postmeddelande, hämtas det relevanta innehållet vanligtvis från den aktiva klientkontexten och paketeras i en begäran som skickas till Zoom AI för bearbetning. Med andra ord hämtar Zoom inte nödvändigtvis det innehållet från ett separat serverbaserat förråd för att fullfölja uppgiften. I stället omvandlas den relevanta informationen från den aktiva tråden, meddelandesamlingen eller annan synlig gränssnittskontext till textform och skickas till Zoom AI från Zoom Workplace-appen så att tjänsten kan utföra naturlig språkbehandling, sammanfattning eller generering.

Diagrammet inkluderar också generativa användningsfall som främst bygger på direkt användarinstruktion snarare än textuellt källmaterial. Till exempel, när en användare begär bildgenerering beskriver användaren önskat resultat genom en uppmaning, och modellen genererar bilden utifrån den beskrivningen. I vissa produktkontexter, till exempel Zoom Whiteboard, kan denna bildgenerering förlita sig på tredjepartsleverantörer av AI-modeller. I andra sammanhang kan Zoom använda sina egna hostade modeller. Till exempel kan Zooms virtuella bakgrundsbildgenerering förlita sig på en Zoom-värdbaserad modell som använder inbäddningar och relaterad bearbetning för att generera visuella resultat, där det resulterande innehållet passerar genom modereringskontroller innan det returneras till användaren.

Sammantaget visar diagrammet att generativa och kompositionsfunktioner ofta är mindre beroende av bevarade artefakter och mer av omedelbar användaravsikt, aktiv klientkontext eller uppladdat stödmaterial. På så sätt representerar de ytterligare ett viktigt driftläge för Zoom AI: inte bara att hämta och resonera över tidigare innehåll, utan också att generera nya resultat direkt från användarens aktuella begäran och omgivande kontext.

Detta diagram är tillämpligt på följande funktioner:

|                   Funktioner                  |                                                                                    Beskrivning                                                                                    |          Produkt(er)          | Bevarande av artefakter |
| :-------------------------------------------: | :-------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------------------------: | :---------------------: |
|               Virtuell bakgrund               |                           Använder AI för att skapa anpassade bilder för virtuell bakgrund utifrån användaruppmaningar för användning i Zoom-sessioner.                           | Möten, evenemang, webbinarium |   Bevaras (om sparat)   |
|                 Bildgenerering                |                 Använder AI för att omvandla whiteboardritningar eller grova visuella artefakter till mer polerade, renderade eller stiliserade visuella resultat.                |           whiteboard          |   Bevaras (om sparat)   |
|                 Bildgenerering                |       Använder AI för att skapa varumärkesanpassade bilder och andra visuella tillgångar för evenemang, såsom sidhuvuden, sessionsbilder och material relaterat till mässor.      |           Evenemang           |   Bevaras (om sparat)   |
|              Innehållsgenerering              | Använder AI för att generera whiteboardinnehåll på skärmen såsom text, klisterlappar, tabeller, tankekartor och andra strukturerade visuella element utifrån användaruppmaningar. |           whiteboard          |   Bevaras (om sparat)   |
|              Innehållsgenerering              |                      Använder AI för att generera skriftligt evenemangsinnehåll såsom beskrivningar, sessionsdetaljer, talarbiografier och lobbymeddelanden.                      |           Evenemang           |   Bevaras (om sparat)   |
|               e-postkomposition               |                                     Använder AI för att utarbeta och förfina e-postinnehåll, inklusive meddelandetexter, ämnesrader och svar.                                     |             e-post            |   Bevaras (om skickat)  |
|                Chattkomponering               |                          Använder AI för att utarbeta och revidera chattmeddelanden baserat på användaruppmaningar och tillgänglig konversationskontext.                          |             Chatt             |   Bevaras (om skickat)  |
|              E-postsammanfattning             |                                       Använder AI för att sammanfatta det viktigaste innehållet i ett e-postmeddelande eller en e-posttråd.                                       |             e-post            |        Ej sparad        |
| Meddelande-, tråd- och dokumentsammanfattning |                          Använder AI för att sammanfatta chattmeddelanden, konversationstrådar och stödda bifogade dokument eller länkat Canvas-innehåll.                         |             Chatt             |        Ej sparad        |
|               Smart uppladdning               |                               Extraherar evenemangsdetaljer från uppladdade filer för att automatiskt bygga sessioner, talare och anpassade frågor.                               |          Zoom Events          |   Bevaras (om sparat)   |

## My Notes

### Mina anteckningar i Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/35722481b7a0175a453ae26b864cafc2a2bc0ae7" alt=""><figcaption><p>Översikt över dataflöden för Mina anteckningar i Zoom Meetings</p></figcaption></figure></div>

Diagrammet ovan visar hur Mina anteckningar inom Zoom Meetings använder mötets befintliga ljudväg i stället för att förlita sig på annat ljud som finns på användarens enhet. När Mina anteckningar är aktiverat under ett Zoom-möte får det åtkomst till det delade mötesljudet som dirigeras genom mötets Multi-Media Router (MMR)-session. Det ljudet bearbetas sedan av Zooms Automatic Speech Recognition (ASR)-tjänst för att generera en avskrift, som levereras till användarens enhet och senare kan stödja generering av anteckningar efter mötet.

I detta flöde baseras transkription specifikt på Zoom Meetings-ljudet som är kopplat till den mötessessionen. Det baseras inte på orelaterat lokalt enhetsljud utanför själva mötet. Efter att mötet har avslutats kan den resulterande avskriften och anteckningarna förbli tillgängliga enligt användarens tillämpliga bevarandeinställningar, medan det underliggande ljud som användes för transkription inte bevaras när bearbetningen är klar.

### Mina anteckningar utanför Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/847318e3160cd31a567ee3cc758fcb40612460cf" alt=""><figcaption><p>Översikt över dataflöden för Mina anteckningar utanför Zoom Meetings</p></figcaption></figure></div>

Diagrammet ovan visar hur Mina anteckningar utanför Zoom Meetings fungerar via användarens lokala enhetsljud i stället för via en delad Zoom-mötessession. Om det är aktiverat under ett tredjepartsmöte eller en diskussion i person kan Mina anteckningar använda åtkomst på operativsystemnivå till användarens mikrofon och, där det är tillämpligt, systemljud för att fånga det lokala ljud som finns tillgängligt på den enheten. Detta ljud dirigeras sedan genom en MMR-session för en enskild användare och bearbetas av Zooms Automatic Speech Recognition (ASR)-tjänst för att generera en avskrift, som levereras till användarens enhet och senare kan stödja generering av anteckningar efter mötet.

Detta innebär att transkription utanför Zoom Meetings enbart baseras på ljudet som överförs från användarens lokala enhet snarare än från en delad Zoom-mötesljudström. Mina anteckningar kan också uppmana användaren att börja en ny anteckning när aktivitet på enhetsmikrofonen detekteras, vilket hjälper till att synliggöra funktionen i situationer som tredjepartsmöten, webbläsarbaserade inspelningar eller andra arbetsflöden där mikrofonen är aktiv. Precis som i flödet under mötet bevaras inte det ljud som används för transkription när transkriptionen är klar, medan de resulterande anteckningarna och avskrifterna kan förbli sparade i användarens konto enligt de tillämpliga bevarandeinställningarna.

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/af644f0b10ffda790a9a3b41b8455906bf0a479e" alt=""><figcaption><p>Översikt över ZoomMate-dataflöden</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **ZoomMate fungerar som en primär arbetsyta i Zoom Workplace**, och fungerar där användarkontext, kopplad kunskap och utförandeförmågor möts. I stället för att bara existera som en fristående assistent står ZoomMate i centrum för en bredare arbetsmiljö där användare kan söka, resonera, skapa och agera över de material och system som stöder deras dagliga arbete.

En stor del av denna roll kommer från ZoomMates Access till **förstapartsinnehåll från Zoom**. Detta kan inkludera artefakter som sammanfattningar, Mina anteckningar, inspelningar, Canvas-dokument, chattmeddelanden och annat användargenererat material som skapats på Zoom-plattformen. Dessa artefakter hjälper till att ge ZoomMate den kontext den behöver för att svara på frågor, sammanställa information, generera resultat och stödja uppföljning. ZoomMate kan också använda **minne**, vilket gör att den kan införliva relevanta användarpreferenser eller arbetsrelaterade detaljer när den hjälper till att slutföra en uppgift.

Diagrammet visar också hur ZoomMate sträcker sig bortom Zoom-inbyggt innehåll genom att integrera med **kunskapskällor från tredje part**. Till exempel kan anslutna molnlagringstjänster som Google Drive eller OneDrive fungera som externa arkiv för information som användaren kan komma åt. När dessa källor integreras kan Zoom indexera godkänt innehåll för att stödja hämtning i hela det materialet, vilket gör att ZoomMate kan använda **agentisk sökning** för att arbeta över både Zoom-innehåll och ansluten kunskap från tredje part. På så sätt kan ZoomMate söka inte bara i det som finns inom Zoom, utan också i de dokument och material som en användare har behörighet att komma åt i anslutna externa plattformar.

Andra personliga datakällor, såsom **e-post och kalender** (med undantag för end-to-end-krypterade e-postmeddelanden), kan också stödja ZoomMate, men de fungerar annorlunda. I stället för att indexeras kommunicerar dessa källor vanligtvis med ZoomMate via direkt API-baserad hämtning. Det gör dem användbara för uppgifter som att hitta relevant e-postkontext, granska kalenderinformation eller hjälpa till att schemalägga händelser, utan att behandla dem som en del av det indexerade hämtningslagret som används för bredare dokumentsökning.

Diagrammet visar dessutom att ZoomMate kan ansluta till ett bredare spektrum av **tjänster och kopplingar från tredje part** som stöder åtgärdsutförande såväl som åtkomst till kunskap. Det kan omfatta system som Jira, HubSpot, ServiceNow, Workday och andra anslutna affärsplattformar. Genom dessa anslutningar kan ZoomMate utföra **agentiska uppgifter** på användarens vägnar, till exempel skapa eller uppdatera poster, hämta information från externa tjänster eller utföra andra anslutna åtgärder i dessa system. Detta gör ZoomMate mer än bara en yta för hämtning och syntes; det fungerar också som ett exekveringslager som kan hjälpa till att omvandla kontext till handling.

Samma grund hjälper också till att driva **agenter** och **arbetsflöden** i ZoomMate-miljön. Agenter kan använda samma underliggande kontext, hämtningsvägar och anslutna system för att ge mer dynamisk, resonemangsbaserad hjälp, vilket hjälper användare att genomföra bredare flerstegsuppgifter med större kontinuitet och anpassningsförmåga. Arbetsflöden kan däremot erbjuda mer strukturerad och upprepningsbar automatisering, vilket gör att användare kan definiera återkommande processer som fungerar över Zoom-innehåll och, där det stöds, anslutna externa system. På så sätt fungerar ZoomMate inte bara som ett konversationsgränssnitt, utan också som en orkestreringspunkt för både dynamisk agentisk aktivitet och mer strukturerad automatisering.

**Sandlåda** kan också stödja vissa av ZoomMates mer avancerade exekveringsfunktioner. För uppgifter som kräver kodexekvering, filgenerering, automatisering eller annan mer sofistikerad bearbetning kan ZoomMate använda en separat sandlådemiljö i stället för att enbart förlita sig på standardiserad konversationsbearbetning. Denna sandlåda körs på Zooms AWS-infrastruktur och tillhandahåller ett kortlivat, isolerat exekveringslager för uppgifter med högre komplexitet, vilket hjälper ZoomMate att utföra vissa operationer i en mer kontrollerad miljö. På så sätt kan samma bredare ZoomMate-grund som stöder hämtning, resonemang, agenter och arbetsflöden också stödja mer avancerat uppgiftsutförande när det begärda arbetet kräver det.

Slutligen visar diagrammet inte varje underliggande komponent som hjälper till att driva ZoomMate. Det visar inte uttryckligen grundläggande förmågelager såsom färdigheter, eller andra stödstrukturer som ingår i Zoom AI:s bredare infrastruktur och design. Dessa element antas fungera inom det underliggande AI-system som möjliggör ZoomMates beteende. Syftet med detta diagram är i stället att visa de primära ytorna för kontext, kunskap och handling genom vilka ZoomMate fungerar som en enhetlig arbetsyta över Zoom och anslutna system.

### ZoomMates anslutningar till tredje part och indexering

<figure><img src="/files/0da1b640fa3dc2e66ae0eed9fd7739df8de8736a" alt="" width="375"><figcaption><p>Översikt över hur ZoomMate ansluter till tredjepartsanslutningar och datakällor</p></figcaption></figure>

Diagrammet ovan illustrerar två relaterade men distinkta delar av ZoomMates tredjepartsdataarkitektur. Den första är hur ZoomMate ansluter till stödda tredjepartsapplikationer och -tjänster så att det kan hämta information eller vidta åtgärder i dessa system. Den andra är hur vissa stödda innehållskällor från tredje part kan matas in och indexeras så att ZoomMate senare kan hämta det innehållet mer effektivt genom hämtningsförstärkt generering.

#### <mark style="color:blå;">ZoomMate kan ansluta direkt till tredjepartsapplikationer och -tjänster</mark>

En del av diagrammet visar hur ZoomMate ansluter till stödda tredjepartsapplikationer som Jira, Confluence, Salesforce, ServiceNow, Workday, molnlagringsplattformar och andra externa affärssystem. Dessa anslutningar gör att ZoomMate kan arbeta bortom Zoom-inbyggt innehåll genom att interagera med verktyg som lagrar affärsdata eller stöder operativt arbete utanför Zoom-plattformen.

Dessa anslutningar upprättas via en TLS-anslutning genom auktoriserade åtkomstmodeller, såsom API-baserade integrationer eller MCP-baserade anslutningar. I båda fallen arbetar ZoomMate inom de behörigheter som beviljats av den anslutna tjänsten. Detta gör att ZoomMate kan hämta relevant information från dessa system och, där det stöds, vidta åtgärder i dem på användarens vägnar. Till exempel kan ZoomMate hämta detaljer från ett Jira-ärende, söka på en Confluence-sida, uppdatera en post i ServiceNow eller använda ett annat anslutet system som en del av att utföra en bredare uppgift.

Denna direkta anslutningsmodell är särskilt viktig för uppgifter som är beroende av aktuellt systemtillstånd eller live-åtkomst till verktyg från tredje part. I dessa fall kan ZoomMate använda den anslutna applikationen som en aktiv tjänsteändpunkt i stället för bara som ett arkiv för tidigare indexerat innehåll.

#### <mark style="color:blå;">ZoomMate kan indexera godkänt innehåll från tredje part för senare hämtning</mark>

En andra del av diagrammet visar hur ZoomMate kan ta emot och indexera innehåll från stödda källor från tredje part så att material senare kan hämtas som en del av ett sökresultat eller ett AI-assisterat svar. Denna indexerade hämtningsmodell är mest relevant för anslutna innehållsarkiv såsom molnlagringssystem, kunskapsbaser, dokumentplattformar och andra stödda källor där ZoomMate kan behöva söka i en större mängd bevarat externt innehåll.

När en stödjd källa är ansluten och godkänd för indexering kan ZoomMate hämta innehåll från den källan och förbereda det för senare sökning. Denna förberedelseprocess kan omfatta att dela upp större filer eller poster i mindre enheter och lägga till metadata såsom källa, uppdateringstid, ägarskap och behörighetsinformation. Det innehållet skrivs sedan in i Zooms indexeringslager så att det senare kan sökas både genom exakta matchningar och betydelsebaserad hämtning.

När en användare skickar en förfrågan som är beroende av indexerat innehåll från tredje part kan ZoomMate söka i det indexerade materialet, bedöma vilka resultat som är mest relevanta och tillämpa den behörighetsinformation som är kopplad till den ursprungliga källan så att endast auktoriserat innehåll kan visas. Det mest relevanta auktoriserade innehållet kan sedan överföras till ZoomMates AI-lager som stödjande kontext för svaret. På så sätt visar diagrammet hur indexerat innehåll från tredje part kan hjälpa ZoomMate att ge svar som är förankrade i faktiskt anslutet affärsmaterial i stället för att enbart förlita sig på allmän modellkunskap.

## Anpassade avatarer

### Skapande av avatar

<div data-with-frame="true"><figure><img src="/files/6bcdbc91b930752055aa4615169575c5865aa6e9" alt=""><figcaption><p>Översikt över processen för skapande av anpassad avatar</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur en anpassad avatar skapas från en användares inspelade video och röst. Processen börjar när användaren får ett manus presenterat för sig och uppmanas att spela in sig själv när hen läser det. Detta vägledda inspelningsteg gör att Zoom kan fånga det audiovisuella material som behövs för att generera både användarens avatarlikhet och den tillhörande röstmodellen som används i senare avatarbaserade resultat.

Efter att användaren har slutfört inspelningen behandlas ljud- och videodelarna via olika vägar. Ljudet skickas till en tjänst från tredje part som genererar en röstart baserad på användarens inspelade tal. När den behandlingen är klar returnerar tjänsten från tredje part en unik röstidentifierare till Zoom. Zoom lagrar denna identifierare som användarens röstreferens så att den senare kan användas när avatarbaserade klipp eller andra stödda resultat som bygger på den syntetiserade rösten genereras.

Samtidigt skickas videodelen till en Zoom-värd avatargenereringsmodul, där Zoom bearbetar det inspelade visuella materialet för att skapa användarens avatarrepresentation. Detta resulterar i en avatarmall som Zoom lagrar för framtida bruk. Tillsammans gör dessa två bevarade utdata—den lagrade röstidentifieraren och den lagrade avatarmallen—att Zoom kan generera framtida klipp eller avatarbaserat innehåll som återger både användarens utseende och den syntetiserade rösten.

### Klippskapande

<div data-with-frame="true"><figure><img src="/files/827367230cfbbc49e8a0424bb3944ba6f3626fda" alt=""><figcaption><p>Översikt över processen för skapande av anpassat avatar-klipp</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur ett anpassat avatar-klipp skapas från en användares lagrade avatar och syntetiserade röstprofil. Processen börjar när användaren laddar upp manuset som avataren ska presentera. Det manuset fungerar som källinnehåll för det genererade klippet.\
\
Därifrån samordnar Zooms webbbackend två parallella indata som behövs för att skapa slutresultatet. Först skickar den användarens lagrade röstidentifierare tillsammans med manuset till den tredje partens röstgenereringstjänst, som producerar ljudet för klippet med användarens syntetiserade röst. För det andra skickar den användarens lagrade avatarmall till Zooms avatargenereringsmodul så att den visuella delen av klippet kan förberedas med den avatarlikhet som användaren tidigare skapat.\
\
När tjänsten för röstgenerering från tredje part har producerat ljudet returneras det ljudet till Zoom och skickas in i avatargenereringsmodulen. Avatargenereringsmodulen kombinerar sedan den lagrade avatarmallen med det genererade ljudet och synkroniserar avatarens ansikts- och munrörelser med det talade innehållet. När denna läppsynkning och renderingsprocess är klar producerar Zoom det färdiga avatar-klippet och levererar tillbaka det till användaren.

## Anpassad ordlista

<div data-with-frame="true"><figure><img src="/files/e1a31a530119f2b2fc91d2d05d8f7260ab4b4912" alt=""><figcaption><p>Dataflöden för anpassad ordlista</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur funktioner för Anpassad ordlista hjälper till att förbättra noggrannheten i talbaserade Zoom-resultat genom att ge Zooms tjänst för automatisk taligenkänning (ASR) ytterligare vokabulärkontext. Denna funktion är utformad för att stödja ord, förkortningar, fackspråk, produktnamn eller specialiserad terminologi som kan vara specifik för ett företag, en bransch, ett team eller en region och som annars kanske inte skulle kännas igen eller återges korrekt under transkription.

Processen börjar när en kontoadministratör skapar och lagrar en anpassad ordlista i Zoom-webbportal. Den ordlistan innehåller listan över godkända ord eller fraser som organisationen vill att Zoom ska känna igen mer exakt. När ordlistan har sparats på kontonivå blir den tillgänglig för användning i stödda mötes- och talbearbetningssammanhang.

När en användare senare startar ett möte kan Zooms AASR-tjänst ta emot kontots anpassade ordlista som en del av sitt bearbetningssammanhang. När ASR-tjänsten omvandlar ljud i realtid till tal-till-text-data kan den jämföra uppfattat tal mot den anpassade ordlistan och försöka mappa igenkända ljud till de lagrade termerna. Detta ger ASR ytterligare vägledning om vilka ord den ska leta efter, hur vissa termer kan stavas och hur förkortningar eller specialiserat språk ska tolkas.

Resultatet är att den inledande tal-till-text-utdata mer korrekt kan återge terminologin som faktiskt användes i mötet. Den förbättrade noggrannheten kan sedan föras vidare till efterföljande artefakter som härleds från samtalet. Om till exempel en mötessammanfattning, undertexter, avskrift eller annan tillgång som bygger på tal-till-text-data senare genereras kan dessa resultat ge en mer korrekt återgivning av orden som yttrades under mötet, vilket hjälper till att förbättra kvaliteten och användbarheten hos den resulterande AI-genererade artefakten.

## Anpassade mallar för mötessammanfattningar

<div data-with-frame="true"><figure><img src="/files/871ce70ba2912f18832753a77ad985fd1fedcaf5" alt=""><figcaption><p>Dataflöden för anpassade mallar för mötessammanfattningar</p></figcaption></figure></div>

Diagrammet ovan visar hur anpassade mötessammanfattningar genereras från en användardefinierad eller kontodefinierad mall. Processen börjar när en mall skapas och sparas i Zoom. På kontonivå kan en administratör definiera en mall för en anpassad mötessammanfattning för organisatorisk användning. På individuell nivå kan en användare skapa en personlig mall för mötessammanfattning baserat på sina egna preferenser. När den har skapats lagras den valda mallen så att den kan användas vid senare generering av sammanfattningar.

När ett möte avslutas kan Zoom AI använda mötets tal-till-text-data för att generera en sammanfattning som följer strukturen och betoningen i den valda anpassade mallen. Om den anpassade mallen valdes innan mötessammanfattningen genererades tillämpar Zoom AI den mallen direkt när sammanfattningen skapas. Detta gör att resultatet kan återspegla det specifika format, de avsnitt eller de prioriteringar som definieras i mallen, snarare än enbart en standard struktur för sammanfattningar.

Om en anpassad mall inte valdes innan sammanfattningen genererades första gången, kan Zoom endast tillämpa mallen senare om mötets avskrift behölls. I så fall kan Zoom AI bearbeta den behållna avskriften på nytt med hjälp av mallens konfiguration och skapa en ny sammanfattning som är anpassad till den strukturen. Om avskriften inte behölls har Zoom dock inte den underliggande avskriften tillgänglig för ombearbetning, vilket innebär att den anpassade mallen inte kan tillämpas i efterhand.

## Personlig ljudisolering

<div data-with-frame="true"><figure><img src="/files/e0a80404c0b0e874d76370e8d74015d3f1f598f3" alt=""><figcaption><p>Översikt över hur Personlig ljudisolering isolerar en användares röst</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **Personlig ljudisolering** fungerar genom att använda en röstprofil som lagras lokalt på användarens enhet för att skilja användarens tal från omgivande bakgrundsljud. Processen börjar när användaren spelar in ett röstprov via funktionen Personlig ljudisolering i Zoom Workplace-appen. Inspelningen används för att skapa en lokal röstprofil som hjälper applikation att känna igen användarens röstegenskaper. Röstprofilen finns kvar på den lokala datorn och överförs inte till Zoom-moln.

När användaren senare talar under ett möte i en miljö med omgivande ljud använder Zoom Workplace-appen den lokalt lagrade röstprofilen för att identifiera användarens talmönster och skilja dem från omgivande ljud. Detta gör det möjligt för applikation att minska bakgrundsljud och isolera användarens röst mer effektivt innan ljud skickas vidare genom mötesflödet.

Resultatet är att ljud som överförs till Zoom-moln är det förfinade mötesljudet, där omgivande ljud har filtrerats bort i den utsträckning som stöds av funktioner. Användarens underliggande röstprofil skickas inte till Zooms molninfrastruktur. På så sätt fungerar Personlig ljudisolering som en lokal bearbetningsfunktion på enhetsnivå som förbättrar ljudets tydlighet innan det rensade ljudet överförs till den direktsända Zoom-sessionen.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/sv/ai/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
