> For the complete documentation index, see [llms.txt](https://library.zoom.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://library.zoom.com/technical-library/sv/ai-whitepaper/diagrams.md).

# Diagram och dataflöden

Zooms AI-funktioner spänner över ett brett spektrum av produkter, tjänster och arbetsflöden, vilket innebär att inget enskilt diagram rimligen eller fullständigt kan fånga hur AI fungerar över hela Zoom-plattformen. Olika funktioner är beroende av olika indata, bearbetningsvägar, lagringsbeteenden, modellinteraktioner och utdata. Vissa fungerar endast med live, tillfälliga data under en aktiv interaktion, medan andra skapar bevarade artefakter som senare kan stödja ytterligare funktioner. Vissa funktioner förblir helt inom Zooms förstapartsmiljö, medan andra bygger på Zooms federerade AI-arkitektur och, i vissa fall, anslutna externa system. För att göra detta dynamiska och omfattande system lättare att förstå presenterar den här sidan en serie diagram i stället för att förlita sig på en enda visuell modell. Var och en belyser ett annat lager, en annan väg eller ett annat funktionsmönster inom den bredare Zoom AI-plattformen. Längst ned i dessa avsnitt finns tabeller som beskriver vilka funktioner som är tillämpliga, deras associerade produkt och deras status för bevarande av artefakter. Senare avsnitt undersöker sedan vissa skräddarsydda produktfunktioner var för sig och ger mer fokuserade förklaringar av hur just dessa specifika funktioner fungerar.

Serien börjar nedan med en förenklad översikt över Zoom AI i sin mest grundläggande form, där plattformen visas i ett first-party-centrerat tillstånd som använder Zooms standard federerade modellarkitektur men ännu inte introducerar tredjepartsaffärsintegrationer eller externa kunddatakällor utöver Zooms tredjepartsleverantörer av AI-modeller. Därifrån introducerar diagrammen gradvis mer specialiserade delar av plattformen, inklusive Zooms alternativ för AI-strategi, omvandlingen av live-ljud till AI-användbara artefakter och de sätt på vilka dessa artefakter senare kan stödja andra funktioner och arbetsflöden. Tillsammans är dessa diagram avsedda att göra ett mycket komplext system mer lättillgängligt genom att bryta ned det i mindre, enklare att följa vyer som speglar hur olika delar av Zooms AI-plattform fungerar i praktiken.

## **Zoom AI**

<div data-with-frame="true"><figure><img src="/files/92a42e0964ff932f8639bd2bb4871be2e867751b" alt=""><figcaption><p>En enkel översikt över Zoom AI</p></figcaption></figure></div>

Diagrammet ovan presenterar Zooms AI-plattform i en förenklad form och visar plattformen i ett av dess mest grundläggande tillstånd. Det illustrerar hur olika delar av Zooms bredare produkt- och tjänstearkitektur, känd som Zoom Web-backend, inklusive områden som Meetings, Phone, kontaktcenter, automatisk taligenkänning och andra Zoom-erbjudanden, matar in i den större Zoom-plattformen och bidrar till mängden innehåll som är tillgängligt för användare och som kan stödja AI-funktionalitet längre ned i kedjan.

Ett centralt koncept i detta diagram är **Zooms innehåll som skapats av användare**. Detta syftar på innehåll som genereras genom en användares interaktioner med Zooms produkter och tjänster och som senare kan fungera som indata, sammanhang eller artefakter för AI-drivna upplevelser. Beroende på vilken produkt och funktion som är inblandad kan detta omfatta material som meddelanden i Zoom Chatt, mötesammanfattningar, transkriptioner, Canvas-dokument, My Notes, inspelningar och andra liknande artefakter som är riktade till användare. Dessa material utgör en viktig del av det kontextuella lagret som kan stödja senare AI-assisterad hämtning, resonemang, sammanfattning och uppföljning.

En del av detta innehåll kan också förberedas för framtida AI-användning genom hämtningsinfrastruktur såsom indexerad hämtning eller moduler för retrieval-augmented generation. I sådana fall kan relevanta artefakter tas in och indexeras så att de kan lokaliseras och användas mer effektivt i senare AI-frågor eller processer. Detta hjälper Zoom AI att arbeta inte bara med live-interaktioner, utan också med bevarat sammanhang och tidigare material som genererats av användare över hela plattformen.

Slutligen introducerar diagrammet också **Zoom AI** sig självt som det gemensamma AI-lagret som fungerar över detta bredare ekosystem. I denna förenklade vy visas Zoom AI genom Zooms standard federerade angreppssätt, där Zoom kan använda både modeller som hostas av Zoom och körs i Zooms egen infrastruktur samt utvalda tredjepartsleverantörer av AI-modeller när det är lämpligt för den aktuella uppgiften. Denna federerade modell gör det möjligt för Zoom att dirigera AI-uppgifter genom den mest lämpliga tillgängliga modellmiljön samtidigt som en enhetlig AI-upplevelse upprätthålls över hela plattformen.

## Zoom AI:s tillvägagångssätt för servicemodeller

<div data-with-frame="true"><figure><img src="/files/640385f069f1c197a424af47ea9685017c8d2bec" alt=""><figcaption><p>Översikt över Zooms AI-tillvägagångssätt, inklusive den federerade metoden, ZM+ och ZMO</p></figcaption></figure></div>

Diagrammet ovan illustrerar Zooms tre AI-tillvägagångssätt: den federerade metoden, Zoom-hostade modeller Plus (ZM+) och Endast Zoom-hostade modeller (ZMO). Tillsammans representerar dessa de tre primära sätt på vilka Zoom tillhandahåller AI-tjänster till kunder, där varje alternativ erbjuder en annan balans mellan funktionernas bredd, modellflexibilitet och datakontroll.

Den federerade metoden är Zooms standard och mest kompletta tillvägagångssätt vad gäller funktioner. Den gör det möjligt för Zoom att arbeta med flera AI-leverantörer, inklusive Zoom-hostade modeller och utvalda modellpartner från tredje part, så att uppgifter kan dirigeras till den modell som är bäst lämpad för begäran. ZM+ erbjuder en mer kontrollerad distributionsmodell genom att använda Zoom-hanterade dedikerade modellinstanser, medan Endast Zoom-hostade modeller (ZMO) håller AI-bearbetningen inom Zoom-hostade modeller och erbjuder den mest restriktiva och kontrollerade modellvägen, men med en mer begränsad uppsättning funktioner.

För denna sida illustrerar diagrammen som följer i allmänhet den federerade metoden, eftersom den återspeglar Zooms standardansats och den bredaste bilden av Zoom AI-funktionaliteten. Organisationer som använder ZM+ eller ZMO kan ofta tolka dessa samma diagram genom att mentalt ta bort tredjepartsleverantörerna av AI-modeller och fokusera på de återstående Zoom-hanterade delarna av flödet.

Se sidan om Zoom AI-modeller, bearbetning, lagring och användning för mer information.

## Live-mediefunktioner och artefakter

<div data-with-frame="true"><figure><img src="/files/801d0b7d9a8e2619161654ff07fe6970dc64c054" alt=""><figcaption><p>Översikt över hur live-media omvandlas till tal-till-text-data som driver Zoom AI-funktioner</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur interaktioner med live-media — såsom möten och telefonsamtal — kan ge upphov till efterföljande AI-drivna funktioner och artefakter på Zoom-plattformen. I varje fall går live-ljud in i Zoom via den anslutningspunkt som är kopplad till den produkten eller tjänsten. För möten är detta vanligtvis **Multimedia-router (MMR)**. För telefoni kommer ljud vanligtvis in via **SIP-zoner**.

När ljudet har matats in dirigeras det till Zooms **Automatisk taligenkänning (ASR)** tjänst, som omvandlar det direktsända ljudet till **tal-till-text-data**. Dessa tal-till-text-data kan användas på flera sätt beroende på de aktiverade inställningarna och funktionerna. I vissa fall levereras de omedelbart till användarna som **direkttextning**. I sammanhang som stöds kan det också skickas vidare till Zooms **Liveöversättning** tjänst, som översätter tal-till-text-utmatningen till översatta undertexter för deltagare på andra språk.

Tal-till-text-data kan också stödja mer varaktiga eller derivata funktioner. Om **transkription** är aktiverad, eller om en användare använder **Mina anteckningar**, kan ASR-tjänsten skapa en avskrift efter att live-sessionen avslutas. Om bevarande av avskrift inte är aktiverat, sparas dock inte tal-till-text-data som används under interaktionen som en permanent avskrift. Även i dessa fall kan Zoom AI fortfarande använda tal-till-text-data tillfälligt under sessionen för att stödja live-AI-funktioner.

Till exempel kan en användare fråga **frågor under möte** via Zoom AI under ett möte. I så fall kan Zoom AI använda de live-tal-till-text-data från mötet för att tolka användarens fråga och generera ett relevant svar som bygger på den pågående konversationen.

En viktig skillnad i detta flöde är att Zoom AI inte nödvändigtvis behåller en avskrift av konversationen bara för att tal-till-text-data användes under sessionen. Om inte bevarande av avskrift specifikt är aktiverat, eller om data bevaras genom funktioner såsom **Mina anteckningar**, tal-till-text-data i sig kan förbli tillfällig. Samtidigt kan vissa nedströmsartefakter som skapas från dessa data kvarstå. Om till exempel en användare ställer frågor under ett möte kan den resulterande AI-konversationen eller relaterade anteckningar senare förbli tillgängliga som en bevarad artefakt även när ingen beständig avskrift skapas.

Vissa bevarade artefakter kan också bli grunden för ytterligare nedströmsartefakter och arbetsflöden. En mötessammanfattning, webbinariumssammanfattning, samtalssammanfattning eller en användares My Notes kan konverteras till en **Zoom Canvas** dokument, där det kan fortsätta att redigeras, utökas och användas som en arbetsartefakt. I sin tur kan dessa resulterande dokument senare fungera som sammanhang för andra AI-funktioner eller arbetsflöden som diskuteras någon annanstans i detta dokument. På detta sätt kan direkt ljud leda inte bara till omedelbara AI-funktioner, utan också till en kedja av bevarade artefakter som fortsätter att stödja senare AI-assisterat arbete över hela Zoom-plattformen.

Detta diagram gäller för följande funktioner:

|           funktioner          |                                              Beskrivning                                              |     Produkt(er)    | Artefaktbevarande |
| :---------------------------: | :---------------------------------------------------------------------------------------------------: | :----------------: | :---------------: |
|        Liveundertexter        |                     Tal-till-text-undertexter i realtid för direktsända sessioner.                    | Möten, webbinarier |     Ej bevarad    |
|     översatta undertexter     |            Översatta undertexter i realtid som genereras från tal-till-text-data i realtid.           | Möten, webbinarier |     Ej bevarad    |
|           Avskrifter          |                        Bevarade textposter av tal-till-text-innehåll från möte.                       |    Möte, telefon   |      Bevarad      |
|      mötessammanfattning      |    AI-genererad sammanfattning av viktiga diskussionspunkter, beslut och åtgärdspunkter från möte.    |        Möten       |      Bevarad      |
| Sammanfattning av webbinarium |      AI-genererad sammanfattning av centralt innehåll från webbinarium som delas efter sessionen.     |     Webbinarier    |      Bevarad      |
|    Sammanfattning av samtal   |            AI-genererad sammanfattning efter samtal av viktiga detaljer och åtgärdspunkter.           |       Telefon      |      Bevarad      |
|       Mina anteckningar       | Personliga anteckningar, avskrift och kontext från möte bevarade för senare referens och uppföljning. |        Möten       |      Bevarad      |
|     Uppföljningsuppgifter     |                    AI-föreslagna uppföljningsåtgärder baserade på samtalsdetaljer.                    |     Zoom Tasks     |      Bevarad      |
|  Prioritering av röstbrevlåda |              AI-baserad rangordning av röstbrevlådor efter användardefinierad viktighet.              |       Telefon      |      Bevarad      |
|         Frågor om möte        |                     AI-svar på frågor om möte med hjälp av mötekontext i realtid.                     |        Möten       |      Bevarad      |
|     Frågor om webbinarium     |              AI-svar på frågor om webbinarium med hjälp av webbinariumkontext i realtid.              |     Webbinarier    |      Bevarad      |
|        Frågor om samtal       |                   AI-svar på frågor om samtal med hjälp av samtalskontext i realtid.                  |       Telefon      |      Bevarad      |

## Inspelningsfunktioner

<div data-with-frame="true"><figure><img src="/files/03c7fe3be26efe20093f941fcb253966852ec167" alt=""><figcaption><p>Översikt över hur Zoom bearbetar inspelningar och AI-funktioner</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur Zoom AI stöder **AI-funktioner baserade på inspelningar** genom att arbeta på den slutförda inspelningen efter att den live sessionen har avslutats. Liksom andra ljudbaserade Zoom-upplevelser kommer det ursprungliga mediet in via infrastrukturen som är kopplad till den produkt som används—såsom den **MMR** för möten eller den relevanta **SIP-zon** för telefoni. Som en del av det flödet skapas inspelningen och skickas till Zooms inspelningstjänst, där den slutförda inspelningen sedan lagras i Zooms innehållslagring.

När inspelningen har färdigställts skickas ljudet som är associerat med den inspelningen till Zooms **Automatisk taligenkänning (ASR)** transkriptionsservice. Denna process producerar en **inspelningsspecifik avskrift**, som kan skilja sig från tal-till-text-data som genereras under själva live sessionen. Med andra ord genereras avskriften som är kopplad till en slutförd inspelning som en del av flödet för efterbearbetning av inspelningen snarare än att helt enkelt kopieras från lagret för liveinteraktion.

När inspelningsavskriften har producerats kan den sedan skickas till **Zoom AI** Zoom AI för ytterligare analys. I detta skede bearbetar Zoom AI avskriften för att identifiera mer övergripande inspelningsartefakter, såsom sammanfattningar, höjdpunkter, kapitel och andra strukturerade representationer av samtalet. Denna analys utförs med hjälp av Zooms AI-bearbetningslager, inklusive Zoom-värdade modeller där det är tillämpligt, för att omvandla den råa inspelningsavskriften till mer användbara utdata efter möte eller efter samtal.

När analysen är klar kopplas de resulterande AI-genererade artefakterna till själva inspelningen. Det är detta som gör att användare som tittar på en inspelning inte bara ser inspelningen och avskriften, utan också de ytterligare AI-genererade lager som gör innehållet enklare att navigera i och förstå. På så sätt visar diagrammet hur en slutförd inspelning kan bli grunden för ett andra steg av AI-bearbetning, vilket producerar berikade inspelningsfunktioner som sträcker sig bortom det ursprungliga lagrade mediet.

Detta diagram gäller för följande funktioner:

|                    funktioner                    |                                                                     Beskrivning                                                                     | Produkt(er) | Artefaktbevarande |
| :----------------------------------------------: | :-------------------------------------------------------------------------------------------------------------------------------------------------: | :---------: | :---------------: |
|                 smart inspelning                 |                                     AI-genererade höjdpunkter, kapitel och sammanfattningar för inspelade möten                                     |    Möten    |      Bevarad      |
|     Generera titlar, beskrivningar och taggar    |                                              AI-genererade titlar, beskrivningar och taggar för klipp.                                              |    Klipp    |      Bevarad      |
| AI-innehållsskapande för inspelningar och videor | Använder avskrifter av evenemangsinspelningar för att generera skriftligt innehåll och AI-curerade videosnuttar från viktiga ögonblick i sessionen. | Zoom Events |      Bevarad      |

## Avledda AI-funktioner

<div data-with-frame="true"><figure><img src="/files/ddc8e3522234f9fd3a763530a37180cb780bc2a4" alt=""><figcaption><p>Översikt över hur Zoom hanterar funktioner för generering av härlett AI-innehåll</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **härledda AI-funktioner** arbeta genom att använda innehåll som är tillgänglig för användare som kontext för senare AI-assisterade uppgifter och resultat. I dessa fall arbetar Zoom AI inte längre bara utifrån data från pågående interaktioner. I stället utgår den från artefakter som redan finns i användarens bredare innehållsmiljö för att besvara en fråga, sammanställa information eller hjälpa till att skapa ett nytt resultat.

Beroende på uppgiften kan detta sammanhangsrelaterade material innehålla artefakter som chattmeddelanden, mötes sammanfattningar, Mina anteckningar, transkriptioner, Zoom Canvas-dokument, Zoom Slide-detaljpaket, Zoom Paper-dokument, Zoom Mail eller Zoom Calendar-innehåll, ansluten e-post- eller kalenderdata från tredje part, eller filer som användaren laddat upp för att stödja en viss förfrågan. På så sätt använder Zoom AI tidigare skapade Zoom-artefakter, tillsammans med integrerad data på personlig nivå där den finns tillgänglig, för att bidra till att uppnå det slutresultat som en användare har begärt.

Diagrammet visar också att denna process i sig kan generera **nytt innehåll för användare**. Till exempel kan Zoom AI använda befintligt material för att skapa ett nytt Zoom Sheet, ett Zoom Canvas-dokument, en Zoom Slide-presentation eller ett Zoom Paper-dokument. När de väl har skapats blir dessa nya artefakter en del av användarens bredare innehållsarkiv och kan senare användas igen som kontext för framtida AI-assisterade funktioner och arbetsflöden. Detta skapar en lagerindelad utveckling där tidigare användarinnehåll kan stödja senare resultat, och dessa resultat kan i sin tur med tiden bli nya kontextuella artefakter.

Samma mönster kan också förekomma i andra Zoom-ytor. I miljöer som **Zoom hubb** eller **panelen för AI-chatt**, kan användare ställa frågor över hela plattformen eller interagera med dokument och material som är tillgängliga via Zooms AI-produktivitetssvit. I sådana fall arbetar Zoom AI återigen utifrån befintliga artefakter som är tillgängliga för användaren för att tillhandahålla hämtning, sammanställning, frågesvar eller uppföljning, vilket visar hur derivativa AI-funktioner utökar värdet av tidigare innehåll till nya uppgifter och resultat.

{% hint style="info" %}
**Obs**

Lokala filuppladdningar från användare [kan inaktiveras](https://support.zoom.com/hc/en/article?id=zm_kb\&sysparm_article=KB0077150).
{% endhint %}

Detta diagram gäller för följande funktioner:

|      funktioner      |                                                                                  Beskrivning                                                                                  |          Produkt(er)          | Artefaktbevarande |
| :------------------: | :---------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------------------------: | :---------------: |
|  Innehållsgenerering | Innehållsgenerering använder AI för att skapa, förfina, sammanfatta och organisera dokument, presentationer, kalkylblad och andra resultat från kommandon på naturligt språk. | Canvas, Sheets, Paper, Slides |      Bevarad      |
| panelen för AI-chatt |                              Konversationsbaserad AI-assistans för att ställa frågor, generera innehåll och arbeta inom tillgänglig Zoom-kontext.                             |      panelen för AI-chatt     |      Bevarad      |
|     Ställ frågor     |                                                    AI-genererade svar baserade på valda dokument och material i Zoom hubb.                                                    |              hubb             |      Bevarad      |

## Generativa och kompositionsfunktioner

<div data-with-frame="true"><figure><img src="/files/167a9314dad8dcaf2909b03485fbc64898852614" alt=""><figcaption><p>Översikt över hur Zoom bearbetar generativa och kompositionsbaserade AI-förfrågningar</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **generativa och kompositionsfunktioner** fungerar inom Zoom AI-plattformen. Till skillnad från härledda AI-funktioner, som förlitar sig på redan befintligt användarinnehåll för att hjälpa till att uppnå en senare uppgift eller ett senare resultat, drivs generativa och kompositionsfunktioner ofta mer direkt av användarens omedelbara inmatning. I många fall är dessa funktioner inte beroende av bevarade Zoom-artefakter som redan lagras någon annanstans i användarens innehållsmiljö. I stället drivs de huvudsakligen av direkta användarprompter, frågor, uppladdade filer eller det omedelbara skärminnehållet som är kopplat till den aktiva produktupplevelsen.

Denna distinktion är särskilt viktig för funktioner som arbetar med innehåll som är synligt i användarens aktuella kontext snarare än med tidigare indexerade eller bevarade artefakter. Till exempel, när en användare sammanfattar en chatttråd, sammanfattar ett e-postmeddelande eller ber Zoom AI att utarbeta ett svar på ett e-postmeddelande, hämtas det relevanta innehållet vanligtvis från den aktiva klientkontexten och paketeras i en begäran som skickas för behandling av Zoom AI. Med andra ord hämtar Zoom inte nödvändigtvis det innehållet från ett separat serverbaserat arkiv för att utföra uppgiften. I stället omvandlas den relevanta informationen från den aktiva tråden, meddelandemängden eller annan synlig gränssnittskontext till textform och skickas till Zoom AI från Zoom Workplace-appen så att tjänsten kan utföra naturlig språkbehandling, sammanfattning eller generering.

Diagrammet innehåller också generativa användningsfall som främst bygger på direkt användarinstruktion snarare än textuellt källmaterial. Till exempel, när en användare begär bildgenerering beskriver användaren önskat resultat med en prompt, och modellen genererar bilden utifrån den beskrivningen. I vissa produktkontexter, till exempel i Zoom Whiteboard, kan denna bildgenerering förlita sig på tredjepartsleverantörer av AI-modeller. I andra kontexter kan Zoom använda sina egna hostade modeller. Till exempel kan Zooms generering av bilder för virtuell bakgrund förlita sig på en Zoom-hostad modell som använder inbäddningar och relaterad bearbetning för att generera visuella resultat, där det resulterande innehållet passerar modereringskontroller innan det returneras till användaren.

Sammantaget visar diagrammet att generativa och kompositionsfunktioner ofta beror mindre på sparade artefakter och mer på användarens omedelbara avsikt, aktivt klientsidesammanhang eller uppladdat stödmaterial. På så sätt representerar de ett annat viktigt läge för Zoom AI:s funktion: inte bara att hämta och resonera kring tidigare innehåll, utan också att generera nya resultat direkt utifrån användarens aktuella begäran och omgivande sammanhang.

Detta diagram gäller för följande funktioner:

|                  funktioner                  |                                                                                     Beskrivning                                                                                     |          Produkt(er)          |   Artefaktbevarande  |
| :------------------------------------------: | :---------------------------------------------------------------------------------------------------------------------------------------------------------------------------------: | :---------------------------: | :------------------: |
|               virtuell bakgrund              |                            Använder AI för att skapa anpassade bilder för virtuell bakgrund från användarens uppmaningar för användning i Zoom-sessioner.                           | Möten, evenemang, webbinarium | Behållen (om sparad) |
|                Bildgenerering                |                 Använder AI för att omvandla whiteboard-ritningar eller grova visuella artefakter till mer polerade, renderade eller stiliserade visuella resultat.                 |           whiteboard          | Behållen (om sparad) |
|                Bildgenerering                |          Använder AI för att skapa varumärkesanpassade bilder och andra visuella tillgångar för evenemang, såsom rubriker, sessionbilder och material relaterat till expo.          |           Evenemang           | Behållen (om sparad) |
|              Innehållsgenerering             | Använder AI för att generera whiteboard-innehåll på skärmen såsom text, klisterlappar, tabeller, tankekartor och andra strukturerade visuella element från användarens uppmaningar. |           whiteboard          | Behållen (om sparad) |
|              Innehållsgenerering             |                        Använder AI för att generera skriftligt evenemangsinnehåll såsom beskrivningar, sessiondetaljer, talarbiografier och lobbymeddelanden.                       |           Evenemang           | Behållen (om sparad) |
|               e-postkomposition              |                                       Använder AI för att utarbeta och förfina e-postinnehåll, inklusive meddelandetext, ämnesrader och svar.                                       |             e-post            | Behölls (om skickat) |
|               Chattkomposition               |                         Använder AI för att utarbeta och revidera chattmeddelanden baserat på användarens uppmaningar och tillgänglig konversationskontext.                         |             chatt             | Behölls (om skickat) |
|             e-postsammanfattning             |                                        Använder AI för att sammanfatta det viktigaste innehållet i ett e-postmeddelande eller en e-posttråd.                                        |             e-post            |      Ej bevarad      |
| Sammanfattning av meddelande, tråd, dokument |                         Använder AI för att sammanfatta chattmeddelanden, konversationstrådar och bifogade dokument som stöds eller länkat Canvas-innehåll.                         |             chatt             |      Ej bevarad      |
|               Smart uppladdning              |                                Extraherar evenemangsdetaljer från uppladdade filer för att automatiskt skapa sessioner, talare och anpassade frågor.                                |          Zoom Events          | Behållen (om sparad) |

## Mina anteckningar

### My Notes i Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/f8b48b6f87e62ea864c8422c1158b11d0a3da3ec" alt=""><figcaption><p>Översikt över My Notes-dataflöden i Zoom-möten</p></figcaption></figure></div>

Diagrammet ovan visar hur My Notes inom Zoom Meetings använder mötets befintliga ljudväg i stället för att förlita sig på annat ljud på användarens enhet. När My Notes är aktiverat under ett Zoom-möte får det åtkomst till det delade mötesljudet som dirigeras genom mötets Multi-Media Router-session (MMR). Detta ljud bearbetas sedan av Zooms tjänst för Automatic Speech Recognition (ASR) för att skapa en avskrift, som levereras till användarens enhet och senare kan stödja generering av anteckningar efter mötet.

I detta flöde baseras transkription specifikt på Zoom-mötesljudet som är kopplat till den mötessessionen. Den baseras inte på orelaterat lokalt enhetsljud utanför själva mötet. När mötet avslutas kan den resulterande avskriften och anteckningarna fortsätta att vara tillgängliga enligt användarens tillämpliga lagringsinställningar, medan det underliggande ljud som används för transkription inte behålls när bearbetningen är slutförd.

### My Notes utanför Zoom Meetings

<div data-with-frame="true"><figure><img src="/files/e04ebf02332a322889f9b1793f15b25daada1485" alt=""><figcaption><p>Översikt över My Notes-dataflöden utanför Zoom-möten</p></figcaption></figure></div>

Diagrammet ovan visar hur My Notes utanför Zoom Meetings fungerar genom användarens lokala enhetsljud snarare än genom en delad Zoom-mötessession. Om funktionen är aktiverad under ett möte med tredje part eller en diskussion på plats kan My Notes använda åtkomst på operativsystemnivå till användarens mikrofon och, där det är tillämpligt, systemljud för att fånga det lokala ljud som är tillgängligt på den enheten. Detta ljud dirigeras sedan genom en MMR-session för en enskild användare och bearbetas av Zooms tjänst för Automatic Speech Recognition (ASR) för att skapa en avskrift, som levereras till användarens enhet och senare kan stödja generering av anteckningar efter mötet.

Detta innebär att transkription utanför Zoom Meetings enbart baseras på det ljud som överförs från användarens lokala enhet snarare än från en delad Zoom-mötesljudström. My Notes kan också uppmana användaren att påbörja en ny anteckning när aktivitet från enhetens mikrofon upptäcks, vilket hjälper till att synliggöra funktioner i situationer som möten med tredje part, webbläsarbaserade inspelningar eller andra arbetsflöden där mikrofonen är aktiv. Precis som i mötesflödet behålls inte det ljud som används för transkription efter att transkription är slutförd, medan de resulterande anteckningarna och avskrifterna kan förbli sparade i användarens konto enligt tillämpliga lagringsinställningar.

## ZoomMate

<div data-with-frame="true"><figure><img src="/files/af644f0b10ffda790a9a3b41b8455906bf0a479e" alt=""><figcaption><p>Översikt över ZoomMate-dataflöden</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **ZoomMate fungerar som en primär arbetsyta i Zoom Workplace**, och verkar i den punkt där användarkontext, ansluten kunskap och exekveringsförmågor möts. I stället för att bara existera som en fristående assistent befinner sig ZoomMate i centrum av en bredare arbetsmiljö där användare kan söka, resonera, skapa och agera i de material och system som stöder deras dagliga arbete.

En stor del av denna roll kommer från ZoomMates åtkomst till **Zoom-innehåll från förstapart**. Detta kan omfatta artefakter som sammanfattningar, My Notes, inspelningar, Canvas-dokument, chattmeddelanden och annat användargenererat material som skapats över Zoom-plattformen. Dessa artefakter hjälper till att ge ZoomMate den kontext som behövs för att besvara frågor, syntetisera information, generera resultat och stödja uppföljning. ZoomMate kan också använda **minne**, vilket gör att den kan införliva relevanta användarpreferenser eller arbetsrelaterade detaljer när den hjälper till att slutföra en uppgift.

Diagrammet visar också hur ZoomMate går bortom Zoom-eget innehåll genom att integrera med **kunskapskällor från tredje part**. Till exempel kan anslutna molnlagringstjänster som Google Drive eller OneDrive fungera som externa arkiv för information som användaren har åtkomst till. När dessa källor integreras kan Zoom indexera godkänt innehåll för att stödja hämtning över dessa material, vilket gör att ZoomMate kan använda **agentisk sökning** för att arbeta över både Zoom-innehåll och ansluten kunskap från tredje part. På så sätt kan ZoomMate söka inte bara i det som finns inom Zoom, utan också i de dokument och material som en användare har behörighet att få åtkomst till i anslutna externa plattformar.

Andra personliga datakällor, som **e-post och kalender** (exklusive totalsträckskrypterade e-postmeddelanden), kan också stödja ZoomMate, men de fungerar annorlunda. I stället för att indexeras kommunicerar dessa källor vanligtvis med ZoomMate genom direkt API-baserad hämtning. Detta gör dem användbara för uppgifter som att hitta relevant e-postkontext, granska kalenderinformation eller hjälpa till att schemalägga evenemang, utan att behandla dem som en del av det indexerade hämtningslager som används för bredare dokumentsökning.

Diagrammet visar också att ZoomMate kan ansluta till ett bredare utbud av **tjänster och anslutningar från tredje part** som stöder åtgärder samt kunskapsåtkomst. Dessa kan omfatta system som Jira, HubSpot, ServiceNow, Workday och andra anslutna affärsplattformar. Genom dessa anslutningar kan ZoomMate utföra **agentiska uppgifter** på användarens vägnar, som att skapa eller uppdatera poster, hämta information från externa tjänster eller utföra andra anslutna åtgärder i dessa system. Detta gör ZoomMate till mer än en yta för hämtning och syntes; det fungerar också som ett exekveringslager som kan hjälpa till att omvandla kontext till handling.

Samma grund hjälper också till att driva **agenter** och **arbetsflöden** inom ZoomMate-miljön. Agenter kan använda samma underliggande kontext, hämtningsvägar och anslutna system för att ge mer dynamisk, resonemangsbaserad assistans och hjälpa användare att utföra bredare uppgifter i flera steg med större kontinuitet och anpassningsförmåga. Arbetsflöden kan däremot ge mer strukturerad och repeterbar automatisering, vilket gör det möjligt för användare att definiera återkommande processer som fungerar över Zoom-innehåll och, där det stöds, anslutna externa system. På så sätt fungerar ZoomMate inte bara som ett konversationsgränssnitt, utan också som en orkestreringspunkt för både dynamisk agentisk aktivitet och mer strukturerad automatisering.

**Sandbox** kan också stödja några av ZoomMates mer avancerade exekveringsförmågor. För uppgifter som kräver kodexekvering, filgenerering, automatisering eller annan mer sofistikerad bearbetning kan ZoomMate använda en separat sandbox-miljö i stället för att enbart förlita sig på standardmässig konversationsbearbetning. Denna sandbox körs på Zooms AWS-infrastruktur och tillhandahåller ett kortlivat, isolerat exekveringslager för uppgifter med högre komplexitet, vilket hjälper ZoomMate att utföra vissa operationer i en mer kontrollerad miljö. På så sätt kan samma bredare ZoomMate-grund som stöder hämtning, resonemang, agenter och arbetsflöden också stödja mer avancerad uppgiftsexekvering när det efterfrågade arbetet kräver det.

Slutligen avbildar diagrammet inte varje underliggande komponent som hjälper till att driva ZoomMate. Det visar inte uttryckligen grundläggande förmågelager som färdigheter eller andra stödjande strukturer som är en del av den bredare infrastrukturen och designen för Zoom AI. Dessa element antas verka inom det underliggande AI-system som möjliggör ZoomMates beteende. Syftet med detta diagram är i stället att visa de primära ytorna för kontext, kunskap och handling genom vilka ZoomMate fungerar som en enhetlig arbetsyta över Zoom och anslutna system.

### ZoomMate-anslutningar till tredje part och indexering

<figure><img src="/files/0da1b640fa3dc2e66ae0eed9fd7739df8de8736a" alt="" width="375"><figcaption><p>Översikt över hur ZoomMate ansluter till anslutningar från tredje part och datakällor</p></figcaption></figure>

Diagrammet ovan illustrerar två relaterade men separata delar av ZoomMates dataarkitektur för tredje part. Den första är hur ZoomMate ansluter till applikationer och tjänster från tredje part som stöds så att det kan hämta information eller vidta åtgärder inom dessa system. Den andra är hur vissa innehållskällor från tredje part som stöds kan tas in och indexeras så att ZoomMate senare kan hämta det innehållet mer effektivt genom hämtningsförstärkt generering.

#### <mark style="color:blå;">ZoomMate kan ansluta direkt till applikationer och tjänster från tredje part</mark>

En del av diagrammet visar hur ZoomMate ansluter till applikationer från tredje part som stöds, såsom Jira, Confluence, Salesforce, ServiceNow, Workday, molnlagringsplattformar och andra externa affärssystem. Dessa anslutningar gör att ZoomMate kan arbeta bortom Zoom-eget innehåll genom att interagera med verktyg som lagrar affärsdata eller stöder operativt arbete utanför Zoom-plattformen.

Dessa anslutningar upprättas över en TLS-anslutning genom auktoriserade åtkomstmodeller, som API-baserade integrationer eller MCP-baserade anslutningar. I båda fallen arbetar ZoomMate inom de behörigheter som ges av den anslutna tjänsten. Detta gör att ZoomMate kan hämta relevant information från dessa system och, där det stöds, vidta åtgärder i dem på användarens vägnar. Till exempel kan ZoomMate hämta detaljer från ett Jira-ärende, söka på en Confluence-sida, uppdatera en post i ServiceNow eller använda ett annat anslutet system som en del av att utföra en bredare uppgift.

Denna modell för direktanslutning är särskilt viktig för uppgifter som beror på aktuell systemstatus eller liveåtkomst till verktyg från tredje part. I dessa fall kan ZoomMate använda den anslutna applikation som en aktiv tjänsteändpunkt snarare än enbart som ett arkiv för tidigare indexerat innehåll.

#### <mark style="color:blå;">ZoomMate kan indexera godkänt innehåll från tredje part för senare hämtning</mark>

En andra del av diagrammet visar hur ZoomMate kan ta in och indexera innehåll från källor från tredje part som stöds så att material senare kan hämtas som en del av en sökning eller ett AI-assisterat svar. Denna modell för indexerad hämtning är mest relevant för anslutna innehållsarkiv som molnlagringssystem, kunskapsbaser, dokumentplattformar och andra källor som stöds där ZoomMate kan behöva söka i en större mängd bevarat externt innehåll.

När en källa som stöds har anslutits och godkänts för indexering kan ZoomMate hämta innehåll från den källan och förbereda det för senare sökning. Denna förberedelseprocess kan omfatta att större filer eller poster delas upp i mindre enheter och att metadata som källa, uppdateringstid, ägarskap och information om behörighet bifogas. Innehållet skrivs sedan in i Zooms indexeringslager så att det senare kan genomsökas både genom exakt matchning och betydelsebaserad hämtning.

När en användare skickar in en begäran som är beroende av indexerat innehåll från tredje part kan ZoomMate söka i det indexerade materialet, bedöma vilka resultat som är mest relevanta och tillämpa behörighetsinformationen som är kopplad till den ursprungliga källan så att endast auktoriserat innehåll är berättigat att visas. Det mest relevanta auktoriserade innehållet kan sedan föras in i ZoomMates AI-lager som stödjande sammanhang för svaret. På så sätt visar diagrammet hur indexerat innehåll från tredje part kan hjälpa ZoomMate att producera svar som är förankrade i faktiska anslutna Business-material i stället för att enbart förlita sig på generell modellkunskap.

## Anpassade avatarer

### Skapande av avatar

<div data-with-frame="true"><figure><img src="/files/6bcdbc91b930752055aa4615169575c5865aa6e9" alt=""><figcaption><p>Översikt över processen för att skapa en anpassad avatar</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur en anpassad avatar skapas från en användares inspelade video och röst. Processen börjar när användaren presenteras med ett manus och uppmanas att spela in sig själv medan hen läser upp det. Detta vägledda inspelningssteg tillåter Zoom att fånga det audiovisuella material som behövs för att generera både användarens avatarlikhet och den tillhörande röstmodellen som används i senare avatarbaserade utdata.

Efter att användaren har slutfört inspelningen bearbetas ljud- och videokomponenterna via olika vägar. Ljudet skickas till en tjänst från tredje part som genererar en röståtergivning baserad på användarens inspelade tal. När den bearbetningen är klar returnerar tjänsten från tredje part en unik röstidentifierare till Zoom. Zoom lagrar denna identifierare som användarens röstreferens så att den kan användas senare när avatarbaserade klipp eller andra stödda utdata som förlitar sig på den syntetiserade rösten genereras.

Samtidigt skickas videokomponenten till en avatargenereringsmodul som hostas av Zoom, där Zoom bearbetar det inspelade visuella materialet för att skapa användarens avatarrepresentation. Detta resulterar i en avatarmall som Zoom lagrar för framtida bruk. Tillsammans tillåter dessa två sparade utdata — den lagrade röstidentifieraren och den lagrade avatarmallen — Zoom att generera framtida klipp eller avatarmedia som återger både användarens utseende och deras syntetiserade röst.

### Skapande av klipp

<div data-with-frame="true"><figure><img src="/files/827367230cfbbc49e8a0424bb3944ba6f3626fda" alt=""><figcaption><p>Översikt över processen för att skapa ett anpassat avatar-klipp</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur ett anpassat avatar-klipp skapas från användarens lagrade avatar och syntetiserade röstprofil. Processen börjar när användaren laddar upp det manus som hen vill att avataren ska presentera. Det manuset fungerar som källinnehåll för det genererade klippet.\
\
Därifrån samordnar Zooms webbbackend två parallella indata som behövs för att skapa slutresultatet. Först skickar den användarens lagrade röstidentifierare tillsammans med manuset till tjänsten från tredje part för röstgenerering, som producerar ljudet till klippet med användarens syntetiserade röst. För det andra skickar den användarens lagrade avatarmall till Zooms avatargenereringsmodul så att klippets visuella komponent kan förberedas med hjälp av användarens tidigare skapade avatarlikhet.\
\
När tjänsten från tredje part för röstgenerering har producerat ljudet returneras ljudet till Zoom och förs in i avatargenereringsmodulen. Avatargenereringsmodulen kombinerar sedan den lagrade avatarmallen med det genererade ljudet och synkroniserar avatarens ansikts- och munrörelser med det talade innehållet. När denna läppsynkroniserings- och renderingsprocess är klar producerar Zoom det färdiga avatar-klippet och levererar det tillbaka till användaren.

## Anpassad ordlista

<div data-with-frame="true"><figure><img src="/files/e1a31a530119f2b2fc91d2d05d8f7260ab4b4912" alt=""><figcaption><p>Dataflöden för anpassad ordlista</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur funktionen Custom Dictionary, en av Zooms funktioner, hjälper till att förbättra noggrannheten i talbaserade Zoom-utdata genom att ge Zooms tjänst Automatic Speech Recognition (ASR) ytterligare vokabulärkontext. Den här funktionen är utformad för att stödja ord, förkortningar, jargong, produktnamn eller specialiserad terminologi som kan vara specifik för ett företag, en bransch, ett team eller en region och som annars kanske inte skulle kännas igen eller återges korrekt under transkription.

Processen börjar när en kontoadministratör skapar och lagrar en anpassad ordlista i Zoom-webbportalen. Den ordlistan innehåller listan över godkända ord eller fraser som organisationen vill att Zoom ska känna igen mer exakt. När ordlistan har sparats på kontonivå blir den tillgänglig för användning i stödda möte- och talbehandlingssammanhang.

När en användare senare startar ett möte kan Zooms AASR-tjänst ta emot kontots anpassade ordlista som en del av sin bearbetningskontext. När ASR-tjänsten omvandlar live-ljud till tal-till-text-data kan den jämföra uppfattat talat språk med den anpassade ordlistan och försöka mappa igenkända ljud till de lagrade termerna. Detta ger ASR ytterligare vägledning om vilka ord den ska leta efter, hur vissa termer kan stavas och hur förkortningar eller specialiserat språk ska tolkas.

Resultatet är att den initiala tal-till-text-utdata mer exakt kan återspegla den terminologi som faktiskt användes i mötet. Den förbättrade noggrannheten kan sedan föras vidare till nedströmsartefakter som härrör från samtalet. Om till exempel en mötessammanfattning, undertexter, avskrift eller någon annan tillgång baserad på tal-till-text-data senare genereras kan dessa utdata återspegla en mer exakt representation av de ord som yttrades under mötet, vilket bidrar till att förbättra kvaliteten och användbarheten hos den resulterande AI-genererade artefakten.

## Anpassade mallar för mötessammanfattning

<div data-with-frame="true"><figure><img src="/files/871ce70ba2912f18832753a77ad985fd1fedcaf5" alt=""><figcaption><p>Dataflöden för anpassade mallar för mötessammanfattning</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur anpassade mötessammanfattningar genereras från en användardefinierad eller kontodefinierad mall. Processen börjar när en mall skapas och sparas i Zoom. På kontonivå kan en administratör definiera en anpassad mall för mötessammanfattning för användning i organisationen. På individnivå kan en användare skapa en personlig mall för mötessammanfattning baserad på sina egna preferenser. När den har skapats lagras den valda mallen så att den kan tillämpas vid senare generering av sammanfattningar.

När ett möte avslutas kan Zoom AI använda mötets tal-till-text-data för att generera en sammanfattning som följer strukturen och betoningen i den valda anpassade mallen. Om den anpassade mallen valdes innan mötessammanfattning genererades tillämpar Zoom AI den mallen direkt när sammanfattningen skapas. Detta gör att den resulterande utdata kan återspegla det specifika format, de avsnitt eller de prioriteringar som definieras i mallen i stället för endast en standardstruktur för sammanfattningar.

Om en anpassad mall inte valdes innan sammanfattningen först genererades kan Zoom bara tillämpa den mallen senare om mötesavskriften behölls. I så fall kan Zoom AI ombearbeta den behållna avskriften med hjälp av mallens konfiguration och skapa en ny sammanfattning anpassad till den strukturen. Om avskriften däremot inte behölls har Zoom inte den underliggande avskriften tillgänglig för ombearbetning, vilket innebär att den anpassade mallen inte kan tillämpas i efterhand.

## Personlig ljudisolering

<div data-with-frame="true"><figure><img src="/files/e0a80404c0b0e874d76370e8d74015d3f1f598f3" alt=""><figcaption><p>Översikt över hur Personlig ljudisolering isolerar en användares röst</p></figcaption></figure></div>

Diagrammet ovan illustrerar hur **Personlig ljudisolering** fungerar genom att använda ett röstavtryck som lagras lokalt på användarens enhet för att skilja användarens tal från omgivande bakgrundsljud. Processen börjar när användaren spelar in ett röstprov via Personal Ljudisolering-funktioner i Zoom Workplace app. Den inspelningen används för att skapa ett lokalt röstavtryck som hjälper applikationen att känna igen användarens röstegenskaper. Detta röstavtryck finns kvar på den lokala datorn och överförs inte till Zoom-moln.

När användaren senare talar under ett möte i en miljö med omgivningsljud använder Zoom Workplace app det lokalt lagrade röstavtrycket för att hjälpa till att identifiera användarens talmönster och separera dem från omgivande ljud. Detta gör att applikationen kan minska bakgrundsljud och isolera användarens röst mer effektivt innan ljudet skickas vidare genom flödet i mötet.

Som ett resultat är det ljud som sänds till Zoom-moln det förfinade mötesljudet, där omgivningsbuller filtreras bort i den utsträckning som stöds av funktioner. Användarens underliggande röstavtryck i sig självt sänds inte till Zooms molninfrastruktur. På så sätt fungerar Personal Audio Isolation som en lokal bearbetning på enhetsnivå som en funktioner, vilket förbättrar ljudets tydlighet innan det rengjorda ljudet sänds in i det direktsända Zoom session.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://library.zoom.com/technical-library/sv/ai-whitepaper/diagrams.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
