Dedikerad inferens

Egen kapacitet, utan egen drift

Kör dina modeller på reserverade GPU:er i svenska datacenter, med garanterad genomströmning och SLA på kontrakt.

Säkerhet

Inga delade GPU:er

På det delade API:et är dina anrop logiskt isolerade, men kislet delas med andra kunder. Dedikerad inferens tar bort den frågan helt. Din modell, din hårdvara, inget annat på maskinen.

Prestanda

Ingen annans topp blir ditt problem

En delad modell kan vara som mest upptagen precis när du behöver den som mest. Med dedikerad inferens är ingen annan inne på modellen. Kapaciteten är konstant, latensen förutsägbar, och du sätter prioriteringarna.

Pris

När en dedikerad GPU lönar sig

Vid låg volym är det billigast att betala per token. Men efter några miljarder tokens i månaden blir det billigare att reservera GPU:erna än att betala per token. Välj en modell och se var linjerna korsas. Mindre modeller börjar runt 2 500 € per GPU och månad.

Modell
t.ex. 1 × AMD MI300X
€1k€2k€3k€4k€5k0B3.5B7B10.5B14B≈ 8.3BAPI per tokenDedikerad · €2,500/mån
Tokens per månad (miljarder)

Vi räknar med 3 tokens in per token ut, till dagens API-priser. Ditt eget förhållande mellan tokens in och ut avgör var linjerna korsas för dig.

Vill du ha en exakt offert? Kontakta säljteamet

Expertis

Hårdvaran är det minsta problemet

KV-cache-justering, kvantisering, genomströmningsoptimering, övervakning och kapacitetsplanering ingår. Du behåller kontrollen, vi tar hand om driften.

Din modell

Valfri modell, även din egen

En äldre modell vi inte längre har i det delade utbudet, en finjusterad modell du äger, eller något mittemellan. Om vår hårdvara klarar den driftsätter vi den åt dig.

SLA

Garanterad leverans, svart på vitt

Det delade API:et är best effort. Dedikerad inferens levereras med ett avtalat SLA som täcker överenskommen tillgänglighet, svarstider för support och kompensation om vi missar dem.