Kalufs
IA dedicata. Controllo al cliente.

Il vostro lavoro.
I vostri modelli.
Le vostre condizioni.

Hardware fisico conveniente dedicato esclusivamente alla vostra organizzazione. Mai condiviso con un altro cliente.

Parliamo delle vostre esigenze

Mettiamo insieme hardware dedicato, modelli selezionati con cura e le competenze per farli funzionare bene. Decidete voi dove vengono eseguiti, come vengono gestiti i vostri dati e di quali capacità ha bisogno il vostro team.

  • Analizzare ed elaborare dati riservati o proprietari
  • Implementare flussi di lavoro agentici sovrani
  • Generare e modificare contenuti multimediali che mostrano prodotti classificati o non ancora presentati
Un controllo che conta davvero

Mantieni le decisioni che contano.

Concordate le modalità operative che contano per il vostro team: politiche sui dati, capacità dei modelli e modifiche controllate.

I vostri dati e le vostre regole

I dati sono vostri e decidete voi la registrazione dei log di audit e le politiche di conservazione e utilizzo. I vostri dati non lasciano mai i vostri host dedicati; pertanto, Kalufs non li esamina, a meno che voi non ci autorizziate a farlo.
Perché il suolo europeo non garantisce che interessi stranieri non acquisiscano i vostri dati →
Perché la privacy non esaurisce la questione della riservatezza →

Modelli in grado di svolgere il vostro lavoro

Attività legittime possono coinvolgere materiale sensibile. Vi aiutiamo a scegliere e validare i modelli, comprese varianti con rifiuti ridotti o sottoposte ad ablazione dei meccanismi di rifiuto, quando i vostri flussi di lavoro lo richiedono. Siete voi a stabilire le politiche di utilizzo.
Quando i meccanismi di sicurezza bloccano attività legittime →

Cambiamenti deliberati

Concordiamo con voi le modifiche ai modelli e le validiamo sui vostri carichi di lavoro. Kalufs configura e ottimizza i modelli concordati per utilizzare efficacemente l’hardware.
Perché il ciclo di vita dei modelli fa parte del servizio →

Un gateway. La vostra configurazione.

Capacità diverse.
Un unico punto di accesso.

Le vostre applicazioni richiedono un modello concordato o un alias di ruolo. Configuriamo insieme a voi ciò che resta pronto e ciò che viene caricato su richiesta.

Eseguite modelli di famiglie come DeepSeek, Gemma, GLM, Ideogram, Kimi, Krea, LTX, MiMo, Minimax, Mistral, Muse, Qwen e YuE alle vostre condizioni.

Esempio A

Un team di ingegneria

Un nodo dedicato · otto GCD · 512 GB di VRAM
  1. GCD 0Modello di ragionamento · partizione
  2. GCD 1Modello di ragionamento · partizione
  3. GCD 2Modello di ragionamento · partizione
  4. GCD 3Modello di ragionamento · partizione
  5. GCD 4Modello di scrittura · partizione
  6. GCD 5Modello di scrittura · partizione
  7. GCD 6
    Modello di immagini XModello di immagini Y
  8. GCD 7
    Modello di generazione di risorse 3DModello OCR
1 TB di RAM di sistema

Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.

In questo esempio, il modello di ragionamento, il modello di scrittura, la generazione di risorse 3D e l’OCR rimangono residenti in memoria. Il modello di immagini X e il modello di immagini Y sono esposti come endpoint distinti; il modello di immagini selezionato viene caricato su richiesta nel GCD 6, sostituendo l’altro.

Esempio B

Uno studio di ricerca e creatività

Un nodo dedicato · otto GCD · 512 GB di VRAM
  1. GCD 0Modello di scrittura · partizione
  2. GCD 1Modello di scrittura · partizione
  3. GCD 2Modello di scrittura · partizione
  4. GCD 3Modello di scrittura · partizione
  5. GCD 4Modello di generazione video · partizione
  6. GCD 5Modello di generazione musicale
  7. GCD 6
    Modello di immagini XModello di immagini Y
  8. GCD 7
    Modello di sintesi vocaleModello di generazione di risorse 3D
1 TB di RAM di sistema

Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.

In questo esempio, il modello di scrittura, il modello di generazione video, il modello di generazione musicale, il modello di sintesi vocale e il modello di generazione di risorse 3D rimangono residenti in memoria. Il modello di immagini X e il modello di immagini Y sono esposti come endpoint distinti; il modello di immagini selezionato viene caricato su richiesta nel GCD 6, sostituendo l’altro.

Esempio C

Un team legale

Un nodo dedicato · otto GCD · 512 GB di VRAM
  1. GCD 0Modello di scrittura · partizione
  2. GCD 1Modello di scrittura · partizione
  3. GCD 2Modello di scrittura · partizione
  4. GCD 3Modello di scrittura · partizione
  5. GCD 4
    Modello di analisi immaginiModello di analisi video
  6. GCD 5Modello personalizzato di ricerca giuridica e citazioni
  7. GCD 6
    Modello OCRModello di trascrizione vocale
  8. GCD 7
    Modello di traduzioneModello di estrazione strutturata
1 TB di RAM di sistema

Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.

In questo esempio, il modello di scrittura, il modello personalizzato di ricerca giuridica e citazioni, il modello OCR, il modello di trascrizione vocale, il modello di traduzione e il modello di estrazione strutturata rimangono residenti in memoria. Il modello di analisi delle immagini e il modello di analisi video sono esposti come endpoint distinti; il modello di analisi selezionato viene caricato su richiesta nel GCD 4, sostituendo l’altro.

Ogni riquadro rappresenta un die di calcolo GPU (GCD), non un’intera scheda grafica né un perimetro di sicurezza virtuale. I colori ripetuti indicano un modello distribuito su più GCD. I riquadri occupati identificano le allocazioni. I nomi e le etichette dei modelli sono illustrativi.

I modelli di diffusione possono condividere un GCD quando i loro pesi complessivi e la memoria di esecuzione rientrano nella capacità disponibile. La tipica generazione per diffusione non richiede la cache KV autoregressiva in crescita utilizzata da un LLM, ma attivazioni, buffer di attenzione e decodifica di immagini e video richiedono comunque memoria.

Gli stack di inferenza supportati possono trasferire la cache KV degli LLM nella RAM di sistema. La RAM resta sullo stesso host dedicato.

I modelli specifici, l’uso della memoria e le modalità di caricamento vengono concordati in funzione del vostro lavoro.

Un nome stabile. Un aggiornamento concordato.

La vostra applicazione: «reasoning»Modello attualmente concordatoSostituzione validata

Quando vengono rilasciati modelli nuovi e migliori o cambiano le vostre esigenze, possiamo sostituire i modelli su vostra richiesta. Ci assicuriamo che funzionino in modo efficiente sul vostro hardware dedicato e possiamo aiutarvi a personalizzare i modelli di base, eseguire il fine-tuning e adattarli alle vostre necessità. In ogni caso, forniamo un percorso di aggiornamento stabile e concordato.

Spazio per crescere

Iniziate con un nodo.
Crescete insieme al vostro lavoro.

Ogni nodo dispone di connettività ConnectX-6 200GbE. Aggiungi nodi dedicati quando cresce la domanda: per eseguire più attività in parallelo, oppure per distribuire un modello più grande su più nodi con uno stack di inferenza compatibile.

Più lavoro contemporaneamente

Eseguite repliche dei modelli o carichi di lavoro diversi su nodi aggiuntivi.

Nodo A · replica del modello
Nodo B · replica aggiuntiva
ConnectX-6 · connettività di rete 200GbE

Distribuisci le richieste tra le installazioni concordate. La capacità aggiuntiva può supportare più utenti e attività simultanei.

Un modello più grande su più nodi

Distribuisci un modello più grande su più nodi.

Nodo A · partizioni del modello
Nodo B · partizioni restanti del modello
ConnectX-6 · connettività di rete 200GbE

Utilizza una configurazione di inferenza distribuita supportata quando un nodo non basta.

Concordiamo e validiamo il numero di nodi, la suddivisione dei modelli, la topologia di rete e le prestazioni per il vostro carico di lavoro. I nodi aggiuntivi seguono le stesse modalità operative concordate.

La collocazione la scegliete voi

Vicino al vostro lavoro.
Dentro il vostro perimetro.

Scegliete la vostra installazione

Scegliete un’installazione presso la vostra sede oppure l’hosting a Östersund (Svezia). L’hosting a Imperia (Italia) è in arrivo! La scelta del luogo è indipendente da quella dei modelli che restano caricati.

Presso la vostra sede

L’hardware dedicato viene installato fisicamente presso la vostra sede. Potete scegliere un’installazione isolata dalla rete (air-gapped) per un isolamento aggiuntivo.

Aggiornamenti e modifiche richiedono l’accesso fisico all’host. Questo può allungare i tempi di risposta e di risoluzione dell’assistenza. Le modalità di manutenzione e le aspettative di supporto vengono concordate nell’ambito dell’installazione.

Un rack di server dedicato all’interno di un ufficio stilizzato.

Östersund

Nel cuore della Svezia, non lontano da Trondheim in Norvegia e vicino alle montagne, Östersund è «Vinterstaden», la «città dell’inverno». Il data centre del nostro partner è alimentato da energia idroelettrica senza combustibili fossili.

Una città innevata sull’acqua, incorniciata da profili montuosi.

Imperia

In arrivo! Il data centre del nostro partner a Imperia è in costruzione e sarà presto operativo.

Sulla costa ligure ai piedi delle Alpi Liguri, a meno di un’ora dall’area metropolitana di Nizza in Francia, Imperia celebra il suo slogan «il miglior clima d’Italia». Il free cooling riduce il fabbisogno energetico per il raffreddamento, mentre l’abbondante soleggiamento favorisce la produzione di energia solare senza combustibili fossili.

Una città costiera ligure baciata dal sole, tra montagne e mare.
Dall’installazione ai risultati

Più di un host.
Un partner affidabile.

Vi aiutiamo a mettere al lavoro l’hardware, dall’installazione e integrazione all’assistenza continuativa.

Kalufs offre consulenza in sviluppo software, flussi di lavoro agentici, integrazione di sistemi, etichettatura dei dati, operazioni di addestramento, MLOps, red teaming, test di penetrazione, monitoraggio della sicurezza, risposta agli incidenti e fine-tuning gestito.

Parti dal lavoro che devi fare.

Un primo confronto utile comprende:

  • Il vostro settore di attività, le sfide e le opportunità legate alla sovranità dei dati.
  • I vostri flussi di lavoro e le capacità richieste ai modelli.
  • Dove deve avvenire l’elaborazione e chi può accedere ai dati.
  • Le integrazioni, le valutazioni e l’assistenza di cui il vostro team ha bisogno.

Vi interessa? Scriveteci un’e-mail a info@kalufs.se per una conversazione informale sulle vostre esigenze.

Leggi prima di decidere

Motivi diversi
per prendere il controllo.

Articoli su questioni durature, aggiornati nella stessa pagina man mano che gli argomenti evolvono.

La tua privacy

Teniamo alla tua privacy. Non utilizziamo cookie di analisi e non ti tracciamo tra siti web. Utilizziamo Plausible Analytics soltanto per comprendere il traffico aggregato del sito, come il numero di visitatori e le aree geografiche generali di provenienza. Rispettiamo Do Not Track e Global Privacy Control.