Digio infrastruktur

AI-modeller og GPU

Kør agenter på administrerede frontier-modeller i dag – eller lej GPU-kapacitet, implementer dine egne vægte, og diriger Digio-opgaver til private slutpunkter i det samme arbejdsområde.

B2B SaaS websteds UI-mærke. Oversæt til naturlig da: Claude, GPT, Gemini Modelvalg pr. agent GPU leje & BYOM
Administrerede modeller

Modeller tilgængelige i Digio i dag

Tildel en standardmodel pr. agent eller tilsidesættelse pr. opgave. Brugen måles i Digio Tokens fra din plansaldo - den samme tegnebog, uanset om agenten ringer til Sonnet, GPT-4o eller Gemini Flash.

Antropiske Claude

  • Claude Opus 4.7 Flagskibsræsonnement, lang kontekst, arkitektur og strategiarbejde.
  • Claude Opus 4.6 Tidligere generation Opus til stabil analyse af høj kvalitet.
  • Claude Sonnet 4.6 Daglig driver – kodning, skrivning og agentløkker i flere trin.
  • Claude Sonnet 4.5 / 4 Hurtige Sonnet-niveauer med hurtig cachelagring på understøttede arbejdsbelastninger.
  • Claude Haiku 4.5 Lav-latency-kladder, klassificering og store underopgaver.

B2B SaaS websteds UI-mærke. Oversæt til naturlig da: OpenAI

  • GPT-5.5 / GPT-5.4 / GPT-5.2 Seneste GPT-5-familie til generelle og agenturers arbejdsbelastninger.
  • GPT-4.1 & GPT-4o Pålidelig multimodal chat og værktøjsbrug for produktionsagenter.
  • GPT-4o mini Omkostningseffektiv routing til resuméer og lette trin.
  • o3 / o3-pro / o3-mini / o4-mini Fornuftsfokuserede modeller til matematik, planlægning og verifikation.
  • GPT-5.3 Codex & Codex mini Kodegenerering, refaktorer og repo-bevidste agentfærdigheder.

B2B SaaS websteds UI-mærke. Oversæt til naturlig da: Google Gemini

  • Gemini 2.5 Pro Langkontekstforskning og struktureret udvinding.
  • Gemini 2.5 Flash High-throughput agent-trin med konkurrencedygtige token-priser.
  • Gemini 2.0 Flash Ultrahurtige afleveringer til parsing, tagging og batchjob.

Åbne og specialiserede API'er

  • DeepSeek Chat & Reasoner Stærk værdi for chat og kæde-af-tanke stil opgaver.
  • Mistral Large Europæisk vært mulighed for flersprogede agentteams.
  • Llama 3.3 70B Klassemodel med åben vægt via API – parrer godt med privat GPU.
  • Grok 3 Realtidsorienteret model for nyheds- og sociale overvågningsagenter.
  • Sonar Pro Søgebaserede svar til forskningsagenter.
  • Command R+ RAG-venlige arbejdsgange for virksomhedschat og hentning.

Model list and token economics evolve with provider releases. Your workspace shows live options when you assign a model to an agent; Digio Tokens debit from the same balance as in pricing.

Brug

Hvordan agenter vælger en model

Koordinatoren kan anbefale Sonnet vs Opus vs en billigere flashmodel baseret på opgavetype. Superbrugere angiver standarder pr. agentrolle – forskning på Sonnet, endelig gennemgang på Opus, massetagging på Haiku eller Gemini Flash.

  • Per agent — default model in agent settings; override in To do or chat when needed.

  • Metered fairly — input, output, and cached tokens map to Digio Token charges (see usage in your wallet).

  • Skills stay the same — tools and integrations work across models; only latency and cost profile change.

  • Plan limits — more agents and monthly Digio Tokens on higher tiers; top up anytime on the pricing page.

GPU leje

Lej GPU og kør dine egne modeller

Har du brug for en finjustering, et checkpoint med luftgab eller forudsigelige slutningspriser? Tilføj dedikeret GPU-kapacitet til dit Digio-arbejdsområde, installer den serveringsstak, du foretrækker, og peg agenter på dit private slutpunkt.

Dedikerede instanser

Time- eller månedlige GPU-noder (A100, H100, L40S klasse) knyttet til din lejer – isoleret fra andre kunder.

Dine vægte

Upload safetensorer, GGUF, eller træk fra dit register; køre Llama, Mistral, Qwen og tilpassede finjusteringer.

Standard servering

vLLM, TGI, Ollama eller containerbilleder, du vedligeholder – Digio-agenter kalder en OpenAI-kompatibel basis-URL.

Samme orkestrering

At gøre, teamchat, færdigheder og samarbejde uændret - kun slutningen backend er din.

B2B SaaS websteds UI-mærke. Oversæt til naturlig da: Hybrid routing

Send følsomme trin til privat GPU og brug Claude eller GPT til offentlig forskning i én arbejdsgang.

Virksomhedskontrol

VPC-peering, statisk udgang, revisionslogfiler og modeltilladelseslister for regulerede teams.

Medbring din egen model

Installer og tilslut en tilpasset model

Typisk opsætning fra nul til agenter, der ringer til dit slutpunkt:

  1. B2B SaaS websteds UI-mærke. Oversæt til naturlig da: Reserve GPU

    Vælg VRAM, region og oppetid (burst vs. altid tændt). Opbevaring til vægte leveres med instansen eller monterer din spand.

  2. Implementer stakken

    Start et serveringsbillede eller SSH i, installer CUDA-drivere og indlæs kontrolpunkter. Sundhedstjek bekræfter, at modellen er klar.

  3. Registrer slutpunkt

    Tilføj basis-URL, API-nøgle og model-id i arbejdsområdeindstillinger. Digio validerer latenstid og tokenformat, før den går live.

  4. Tildel til agenter

    Vælg din private model som standard for udvalgte agenter; administrerede Claude/GPT-modeller forbliver tilgængelige side om side.

GPU-leje faktureres separat fra Digio-abonnementer. Kontakt os for kapacitetsplanlægning, SLA'er og migrering fra en eksisterende inferensklynge.

B2B SaaS websteds UI-mærke. Oversæt til naturlig da: FAQ

Spørgsmål om modeller og GPU

Valg af administrerede API'er vs selv-hostet inferens på Digio.

Betaler jeg to gange – plan plus API?

Dit Digio-abonnement dækker infrastruktur, agenter og inkluderede Digio-tokens. Administreret modelbrug debiterer denne tokensaldo efter faktiske input/output-tokens. GPU-leje er en tilføjelse til de maskiner, du styrer.

Kan forskellige agenter bruge forskellige modeller?

Ja – hver agent kan have sin egen standard. Opgaver og chats kan tilsidesættes for en enkelt kørsel uden at ændre den globale standard.

Hvad er forskellen mellem Sonnet og Opus?

Opus er indstillet til hårdere ræsonnementer og længere sammenhængende planer; Sonnet er hurtigere og billigere til daglige agentsløjfer. Haiku- og flash-modeller er bedst til volumenunderopgaver.

Kan jeg kun køre min egen model og blokere cloud API'er?

Virksomhedsarbejdsområder kan begrænse udgående modeludbydere og dirigere al agenttrafik til dit GPU-slutpunkt. Hybridtilstand er standard for de fleste hold.

Hvilke GPU-størrelser er tilgængelige?

Tilbuddet afhænger af region og efterspørgsel - almindeligvis 24-80 GB VRAM-niveauer til 7B-70B klassemodeller og multi-GPU-noder til større stakke. Vi hjælper med at dimensionere VRAM ud fra din parametertælling og kvantisering.

Bruger privat GPU stadig Digio Tokens?

Orkestrering (agenter, opgaver, opbevaring) forbliver på din plan. Inferens om din GPU faktureres som GPU-tid; du kan valgfrit måle token-formet brug for intern tilbageførsel.

Vælg administrerede modeller eller medbring din GPU

Start på Claude og GPT i dag, og tilføj derefter dedikeret GPU, når du er klar til at være vært for tilpassede vægte – samme agenter, samme opgaver, din slutning.