Il vostro lavoro.
I vostri modelli.
Le vostre condizioni.
Hardware fisico conveniente dedicato esclusivamente alla vostra organizzazione. Mai condiviso con un altro cliente.
Parliamo delle vostre esigenzeMettiamo insieme hardware dedicato, modelli selezionati con cura e le competenze per farli funzionare bene. Decidete voi dove vengono eseguiti, come vengono gestiti i vostri dati e di quali capacità ha bisogno il vostro team.
- Analizzare ed elaborare dati riservati o proprietari
- Implementare flussi di lavoro agentici sovrani
- Generare e modificare contenuti multimediali che mostrano prodotti classificati o non ancora presentati
Mantieni le decisioni che contano.
Concordate le modalità operative che contano per il vostro team: politiche sui dati, capacità dei modelli e modifiche controllate.
I vostri dati e le vostre regole
I dati sono vostri e decidete voi la registrazione dei log di audit e le politiche di conservazione e utilizzo. I vostri dati non lasciano mai i vostri host dedicati; pertanto, Kalufs non li esamina, a meno che voi non ci autorizziate a farlo.
Perché il suolo europeo non garantisce che interessi stranieri non acquisiscano i vostri dati →
Perché la privacy non esaurisce la questione della riservatezza →
Modelli in grado di svolgere il vostro lavoro
Attività legittime possono coinvolgere materiale sensibile. Vi aiutiamo a scegliere e validare i modelli, comprese varianti con rifiuti ridotti o sottoposte ad ablazione dei meccanismi di rifiuto, quando i vostri flussi di lavoro lo richiedono. Siete voi a stabilire le politiche di utilizzo.
Quando i meccanismi di sicurezza bloccano attività legittime →
Cambiamenti deliberati
Concordiamo con voi le modifiche ai modelli e le validiamo sui vostri carichi di lavoro. Kalufs configura e ottimizza i modelli concordati per utilizzare efficacemente l’hardware.
Perché il ciclo di vita dei modelli fa parte del servizio →
Capacità diverse.
Un unico punto di accesso.
Le vostre applicazioni richiedono un modello concordato o un alias di ruolo. Configuriamo insieme a voi ciò che resta pronto e ciò che viene caricato su richiesta.
Eseguite modelli di famiglie come DeepSeek, Gemma, GLM, Ideogram, Kimi, Krea, LTX, MiMo, Minimax, Mistral, Muse, Qwen e YuE alle vostre condizioni.
Un team di ingegneria
- GCD 0Modello di ragionamento · partizione
- GCD 1Modello di ragionamento · partizione
- GCD 2Modello di ragionamento · partizione
- GCD 3Modello di ragionamento · partizione
- GCD 4Modello di scrittura · partizione
- GCD 5Modello di scrittura · partizione
- GCD 6Modello di immagini XModello di immagini Y
- GCD 7Modello di generazione di risorse 3DModello OCR
Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.
In questo esempio, il modello di ragionamento, il modello di scrittura, la generazione di risorse 3D e l’OCR rimangono residenti in memoria. Il modello di immagini X e il modello di immagini Y sono esposti come endpoint distinti; il modello di immagini selezionato viene caricato su richiesta nel GCD 6, sostituendo l’altro.
Uno studio di ricerca e creatività
- GCD 0Modello di scrittura · partizione
- GCD 1Modello di scrittura · partizione
- GCD 2Modello di scrittura · partizione
- GCD 3Modello di scrittura · partizione
- GCD 4Modello di generazione video · partizione
- GCD 5Modello di generazione musicale
- GCD 6Modello di immagini XModello di immagini Y
- GCD 7Modello di sintesi vocaleModello di generazione di risorse 3D
Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.
In questo esempio, il modello di scrittura, il modello di generazione video, il modello di generazione musicale, il modello di sintesi vocale e il modello di generazione di risorse 3D rimangono residenti in memoria. Il modello di immagini X e il modello di immagini Y sono esposti come endpoint distinti; il modello di immagini selezionato viene caricato su richiesta nel GCD 6, sostituendo l’altro.
Un team legale
- GCD 0Modello di scrittura · partizione
- GCD 1Modello di scrittura · partizione
- GCD 2Modello di scrittura · partizione
- GCD 3Modello di scrittura · partizione
- GCD 4Modello di analisi immaginiModello di analisi video
- GCD 5Modello personalizzato di ricerca giuridica e citazioni
- GCD 6Modello OCRModello di trascrizione vocale
- GCD 7Modello di traduzioneModello di estrazione strutturata
Il caricamento dei modelli, i carichi di lavoro dell’host e l’eventuale trasferimento della cache KV in RAM condividono questa capacità.
In questo esempio, il modello di scrittura, il modello personalizzato di ricerca giuridica e citazioni, il modello OCR, il modello di trascrizione vocale, il modello di traduzione e il modello di estrazione strutturata rimangono residenti in memoria. Il modello di analisi delle immagini e il modello di analisi video sono esposti come endpoint distinti; il modello di analisi selezionato viene caricato su richiesta nel GCD 4, sostituendo l’altro.
Ogni riquadro rappresenta un die di calcolo GPU (GCD), non un’intera scheda grafica né un perimetro di sicurezza virtuale. I colori ripetuti indicano un modello distribuito su più GCD. I riquadri occupati identificano le allocazioni. I nomi e le etichette dei modelli sono illustrativi.
I modelli di diffusione possono condividere un GCD quando i loro pesi complessivi e la memoria di esecuzione rientrano nella capacità disponibile. La tipica generazione per diffusione non richiede la cache KV autoregressiva in crescita utilizzata da un LLM, ma attivazioni, buffer di attenzione e decodifica di immagini e video richiedono comunque memoria.
Gli stack di inferenza supportati possono trasferire la cache KV degli LLM nella RAM di sistema. La RAM resta sullo stesso host dedicato.
I modelli specifici, l’uso della memoria e le modalità di caricamento vengono concordati in funzione del vostro lavoro.
Un nome stabile. Un aggiornamento concordato.
Quando vengono rilasciati modelli nuovi e migliori o cambiano le vostre esigenze, possiamo sostituire i modelli su vostra richiesta. Ci assicuriamo che funzionino in modo efficiente sul vostro hardware dedicato e possiamo aiutarvi a personalizzare i modelli di base, eseguire il fine-tuning e adattarli alle vostre necessità. In ogni caso, forniamo un percorso di aggiornamento stabile e concordato.
Iniziate con un nodo.
Crescete insieme al vostro lavoro.
Ogni nodo dispone di connettività ConnectX-6 200GbE. Aggiungi nodi dedicati quando cresce la domanda: per eseguire più attività in parallelo, oppure per distribuire un modello più grande su più nodi con uno stack di inferenza compatibile.
Concordiamo e validiamo il numero di nodi, la suddivisione dei modelli, la topologia di rete e le prestazioni per il vostro carico di lavoro. I nodi aggiuntivi seguono le stesse modalità operative concordate.
Vicino al vostro lavoro.
Dentro il vostro perimetro.
Scegliete la vostra installazione
Scegliete un’installazione presso la vostra sede oppure l’hosting a Östersund (Svezia). L’hosting a Imperia (Italia) è in arrivo! La scelta del luogo è indipendente da quella dei modelli che restano caricati.
Presso la vostra sede
L’hardware dedicato viene installato fisicamente presso la vostra sede. Potete scegliere un’installazione isolata dalla rete (air-gapped) per un isolamento aggiuntivo.
Aggiornamenti e modifiche richiedono l’accesso fisico all’host. Questo può allungare i tempi di risposta e di risoluzione dell’assistenza. Le modalità di manutenzione e le aspettative di supporto vengono concordate nell’ambito dell’installazione.
Östersund
Nel cuore della Svezia, non lontano da Trondheim in Norvegia e vicino alle montagne, Östersund è «Vinterstaden», la «città dell’inverno». Il data centre del nostro partner è alimentato da energia idroelettrica senza combustibili fossili.
Imperia
In arrivo! Il data centre del nostro partner a Imperia è in costruzione e sarà presto operativo.
Sulla costa ligure ai piedi delle Alpi Liguri, a meno di un’ora dall’area metropolitana di Nizza in Francia, Imperia celebra il suo slogan «il miglior clima d’Italia». Il free cooling riduce il fabbisogno energetico per il raffreddamento, mentre l’abbondante soleggiamento favorisce la produzione di energia solare senza combustibili fossili.
Più di un host.
Un partner affidabile.
Vi aiutiamo a mettere al lavoro l’hardware, dall’installazione e integrazione all’assistenza continuativa.
Kalufs offre consulenza in sviluppo software, flussi di lavoro agentici, integrazione di sistemi, etichettatura dei dati, operazioni di addestramento, MLOps, red teaming, test di penetrazione, monitoraggio della sicurezza, risposta agli incidenti e fine-tuning gestito.
Parti dal lavoro che devi fare.
Un primo confronto utile comprende:
- Il vostro settore di attività, le sfide e le opportunità legate alla sovranità dei dati.
- I vostri flussi di lavoro e le capacità richieste ai modelli.
- Dove deve avvenire l’elaborazione e chi può accedere ai dati.
- Le integrazioni, le valutazioni e l’assistenza di cui il vostro team ha bisogno.
Vi interessa? Scriveteci un’e-mail a info@kalufs.se per una conversazione informale sulle vostre esigenze.
Motivi diversi
per prendere il controllo.
Articoli su questioni durature, aggiornati nella stessa pagina man mano che gli argomenti evolvono.
- Sovranità e giurisdizione
Gli interessi statunitensi possono raggiungere i vostri dati all’interno di un data centre europeo
Perché l’hosting in Europa non sottrae di per sé il vostro fornitore alla giurisdizione statunitense e cosa comprende la normativa sull’intelligence estera.
- Riservatezza
La privacy non è tutta la questione
Informazioni personali, conoscenze preziose e la distanza tra una promessa e la possibilità di verificarla.
- Capacità
Quando i meccanismi di sicurezza bloccano attività legittime
Cosa ci insegna la risposta all’incidente di Hugging Face sull’importanza di avere pronto un modello locale capace.
- Ciclo di vita
Lo stesso nome di modello può nascondere comportamenti diversi
Perché configurazione, valutazione e cambiamenti controllati contano quanto la qualità dei modelli.
La tua privacy
Teniamo alla tua privacy. Non utilizziamo cookie di analisi e non ti tracciamo tra siti web. Utilizziamo Plausible Analytics soltanto per comprendere il traffico aggregato del sito, come il numero di visitatori e le aree geografiche generali di provenienza. Rispettiamo Do Not Track e Global Privacy Control.