Säkerhet
Inga delade GPU:er
På det delade API:et är dina anrop logiskt isolerade, men kislet delas med andra kunder. Dedikerad inferens tar bort den frågan helt. Din modell, din hårdvara, inget annat på maskinen.
Prestanda
Ingen annans topp blir ditt problem
En delad modell kan vara som mest upptagen precis när du behöver den som mest. Med dedikerad inferens är ingen annan inne på modellen. Kapaciteten är konstant, latensen förutsägbar, och du sätter prioriteringarna.
Pris
När en dedikerad GPU lönar sig
Vid låg volym är det billigast att betala per token. Men efter några miljarder tokens i månaden blir det billigare att reservera GPU:erna än att betala per token. Välj en modell och se var linjerna korsas. Mindre modeller börjar runt 2 500 € per GPU och månad.
Vi räknar med 3 tokens in per token ut, till dagens API-priser. Ditt eget förhållande mellan tokens in och ut avgör var linjerna korsas för dig.
Vill du ha en exakt offert? Kontakta säljteamet
Expertis
Hårdvaran är det minsta problemet
KV-cache-justering, kvantisering, genomströmningsoptimering, övervakning och kapacitetsplanering ingår. Du behåller kontrollen, vi tar hand om driften.
Din modell
Valfri modell, även din egen
En äldre modell vi inte längre har i det delade utbudet, en finjusterad modell du äger, eller något mittemellan. Om vår hårdvara klarar den driftsätter vi den åt dig.
SLA
Garanterad leverans, svart på vitt
Det delade API:et är best effort. Dedikerad inferens levereras med ett avtalat SLA som täcker överenskommen tillgänglighet, svarstider för support och kompensation om vi missar dem.
Driftsättningsalternativ
Välj mellan delad och dedikerad driftsättning, beroende på latensbehov, trafikmönster och hur mycket kontroll du behöver över infrastrukturen.