Kalufs
IA dédiée. Contrôle client.

Votre travail.
Vos modèles.
Vos conditions.

Un matériel physique rentable dédié à votre organisation seule. Jamais partagé avec un autre client.

Discuter de vos besoins

Nous réunissons du matériel dédié, des modèles soigneusement sélectionnés et l'expertise pour les faire fonctionner correctement. Vous décidez où il tourne, comment vos données sont traitées et de quelles capacités votre équipe a besoin.

  • Analyser et traiter des données confidentielles ou exclusives
  • Déployer des flux de travail agentiques souverains
  • Générer et éditer des médias présentant des produits classifiés ou non divulgués
Un contrôle qui a du sens

Gardez les décisions qui comptent.

Convenez des arrangements d'exploitation qui comptent pour votre équipe : politiques de données, capacités des modèles et changements contrôlés.

Vos données et vos politiques

Vous possédez vos données et décidez de la journalisation d'audit, de la conservation et des politiques d'utilisation. Vos données ne quittent jamais vos hôtes dédiés, donc Kalufs ne les inspecte pas sauf si vous nous y autorisez. Nous ne les utilisons ni ne les partageons pour l'entraînement.
Pourquoi le sol européen ne garantit pas contre l'acquisition de vos données par des intérêts étrangers →
Pourquoi la vie privée n'est pas toute la question de la confidentialité →

Des modèles capables de faire votre travail

Un travail légitime peut impliquer des contenus sensibles. Nous vous aidons à sélectionner et valider des modèles, y compris des variantes à refus réduit ou ablitées, lorsque vos flux de travail en ont besoin. Vous définissez les politiques d'utilisation.
Quand les garde-fous bloquent un travail légitime →

Des changements faits délibérément

Nous convenons des changements de modèles avec vous et les validons sur vos charges de travail. Kalufs configure et règle les modèles convenus pour tirer le meilleur parti du matériel.
Pourquoi le cycle de vie des modèles fait partie du service →

Une passerelle. Votre configuration.

Des capacités différentes.
Une entrée partagée.

Vos applications demandent un modèle convenu ou un alias de rôle. Nous configurons avec vous ce qui reste prêt et ce qui se charge à la demande.

Exécutez des modèles de familles telles que DeepSeek, Gemma, GLM, Ideogram, Kimi, Krea, LTX, MiMo, Minimax, Mistral, Muse, Qwen et YuE à vos propres conditions.

Exemple A

Une équipe d'ingénierie

Un nœud dédié · huit GCD · 512 Go de VRAM
  1. GCD 0Modèle de raisonnement · fragment
  2. GCD 1Modèle de raisonnement · fragment
  3. GCD 2Modèle de raisonnement · fragment
  4. GCD 3Modèle de raisonnement · fragment
  5. GCD 4Modèle de texte · fragment
  6. GCD 5Modèle de texte · fragment
  7. GCD 6
    Modèle d'image XModèle d'image Y
  8. GCD 7
    Modèle de génération d'actifs 3DModèle OCR
1 To de RAM système

Le chargement des modèles, les charges de travail de l'hôte et le déchargement optionnel du cache KV se partagent cette capacité.

Le modèle de raisonnement, le modèle de texte, la génération d'actifs 3D et l'OCR restent résidents dans cet exemple. Le modèle d'image X et le modèle d'image Y sont exposés comme des points de terminaison de modèle séparés ; le modèle d'image sélectionné est échangé dans le GCD 6 à la demande.

Exemple B

Un studio de recherche et de création

Un nœud dédié · huit GCD · 512 Go de VRAM
  1. GCD 0Modèle de texte · fragment
  2. GCD 1Modèle de texte · fragment
  3. GCD 2Modèle de texte · fragment
  4. GCD 3Modèle de texte · fragment
  5. GCD 4Modèle de génération vidéo · fragment
  6. GCD 5Modèle de génération musicale
  7. GCD 6
    Modèle d'image XModèle d'image Y
  8. GCD 7
    Modèle de synthèse vocaleModèle de génération d'actifs 3D
1 To de RAM système

Le chargement des modèles, les charges de travail de l'hôte et le déchargement optionnel du cache KV se partagent cette capacité.

Le modèle de texte, le modèle de génération vidéo, le modèle de génération musicale, le modèle de synthèse vocale et le modèle de génération d'actifs 3D restent résidents dans cet exemple. Le modèle d'image X et le modèle d'image Y sont exposés comme des points de terminaison de modèle séparés ; le modèle d'image sélectionné est échangé dans le GCD 6 à la demande.

Exemple C

Une équipe juridique

Un nœud dédié · huit GCD · 512 Go de VRAM
  1. GCD 0Modèle de texte · fragment
  2. GCD 1Modèle de texte · fragment
  3. GCD 2Modèle de texte · fragment
  4. GCD 3Modèle de texte · fragment
  5. GCD 4
    Modèle d'analyse d'imagesModèle d'analyse vidéo
  6. GCD 5Modèle personnalisé de recherche juridique + citations
  7. GCD 6
    Modèle OCRModèle de transcription vocale
  8. GCD 7
    Modèle de traductionModèle d'extraction structurée
1 To de RAM système

Le chargement des modèles, les charges de travail de l'hôte et le déchargement optionnel du cache KV se partagent cette capacité.

Le modèle de texte, le modèle personnalisé de recherche juridique + citations, le modèle OCR, le modèle de transcription vocale, le modèle de traduction et le modèle d'extraction structurée restent résidents dans cet exemple. Le modèle d'analyse d'images et le modèle d'analyse vidéo sont exposés comme des points de terminaison de modèle séparés ; le modèle d'analyse sélectionné est échangé dans le GCD 4 à la demande.

Chaque tuile est une unité de calcul GPU (GCD), pas une carte graphique entière ni une frontière de sécurité virtuelle. Des couleurs répétées montrent un modèle distribué sur plusieurs GCD. Les tuiles occupées identifient les allocations. Les noms et étiquettes de modèles sont illustratifs.

Les modèles de diffusion peuvent partager un GCD lorsque leurs poids combinés et leur mémoire d'exécution le permettent. La génération de diffusion typique n'a pas besoin du cache KV autorégressif croissant utilisé par un LLM, mais les activations, les tampons d'attention et le décodage d'images/vidéo nécessitent toujours de la mémoire.

Les piles de service prises en charge peuvent décharger le cache KV du LLM vers la RAM système. La RAM reste sur le même hôte dédié.

Les modèles exacts, l'utilisation de la mémoire et les arrangements de chargement sont convenus pour votre travail.

Un nom stable. Une mise à niveau convenue.

Votre application : « reasoning »Modèle convenu actuelRemplacement validé

Lorsque de nouveaux modèles, meilleurs, sont publiés ou que vos besoins changent, nous pouvons remplacer les modèles à votre demande. Nous veillons à ce qu'ils tournent efficacement sur votre matériel dédié et pouvons aider à personnaliser, affiner et adapter les modèles fondamentaux à vos besoins. Dans tous les cas, nous fournissons une voie de mise à niveau stable et convenue.

De la place pour grandir

Commencez avec un nœud.
Étendez-vous avec votre travail.

Chaque nœud dispose d'une connectivité ConnectX-6 200GbE. Ajoutez des nœuds dédiés à mesure que la demande grandit : pour servir plus de travail en parallèle, ou pour accueillir un modèle plus grand sur plusieurs nœuds avec une pile de service compatible.

Plus de travail à la fois

Exécutez des répliques de modèle ou différentes charges de travail sur des nœuds supplémentaires.

Nœud A · réplique de modèle
Nœud B · réplique supplémentaire
ConnectX-6 · connectivité réseau 200GbE

Distribuez les requêtes entre les déploiements convenus. Une capacité supplémentaire peut soutenir plus d'utilisateurs et de tâches simultanés.

Un modèle plus grand sur plusieurs nœuds

Distribuez un modèle plus grand sur plusieurs nœuds.

Nœud A · fragments de modèle
Nœud B · fragments de modèle restants
ConnectX-6 · connectivité réseau 200GbE

Utilisez une configuration de service distribuée prise en charge lorsqu'un nœud ne suffit pas.

Nous convenons et validons le nombre de nœuds, le partitionnement des modèles, la topologie réseau et les performances pour votre charge de travail. Les nœuds supplémentaires suivent les mêmes arrangements d'exploitation convenus.

L'emplacement est votre choix

Près de votre travail.
Dans votre périmètre.

Choisissez votre déploiement

Choisissez un déploiement dans vos locaux ou un hébergement à Östersund (Suède). L'hébergement à Imperia (Italie) arrive bientôt ! L'emplacement est un choix distinct de celui des modèles qui restent chargés.

Dans vos locaux

Le matériel dédié est physiquement installé dans vos locaux. Vous pouvez choisir un déploiement isolé (air-gapped) pour une isolation supplémentaire.

Les mises à jour et modifications nécessitent un accès physique à l'hôte. Cela peut allonger les délais de support et de résolution. Les arrangements de maintenance et les attentes de support sont convenus dans le cadre du déploiement.

Un rack de serveur dédié à l'intérieur d'un bureau stylisé.

Östersund

Au milieu de la Suède, non loin de Trondheim en Norvège et près des montagnes, Östersund est « Vinterstaden » — « la ville de l'hiver ». Le centre de données de notre partenaire est alimenté par l'hydroélectricité sans énergie fossile.

Une ville enneigée au bord de l'eau, encadrée par des silhouettes de montagnes.

Imperia

Bientôt disponible ! Le centre de données de notre partenaire à Imperia est en construction et sera bientôt opérationnel.

Sur la côte ligure au pied des Alpes ligures, à moins d'une heure de la métropole niçoise en France, Imperia célèbre son slogan « il miglior clima d'Italia » — « le meilleur climat d'Italie ». Le refroidissement gratuit réduit la demande d'énergie de refroidissement, tandis que l'abondant ensoleillement soutient une production solaire sans énergie fossile.

Une ville côtière ligure ensoleillée entre montagnes et mer.
Du déploiement à la livraison

Plus qu'un hôte.
Un partenaire fiable.

Nous vous aidons à mettre le matériel au travail, du déploiement et de l'intégration jusqu'au support continu.

Kalufs propose du conseil en développement de logiciels, flux de travail agentiques, intégration de systèmes, étiquetage de données, opérations d'entraînement, MLOps, red teaming, tests d'intrusion, surveillance de la sécurité, réponse aux incidents et affinage géré.

Commencez par le travail à faire.

Une première conversation utile couvre :

  • Votre secteur d'activité, vos défis et opportunités de souveraineté des données.
  • Vos flux de travail et les capacités de modèle requises.
  • Où le traitement doit se produire et qui peut accéder aux données.
  • Les intégrations, évaluations et le support dont votre équipe a besoin.

Intéressé ? Envoyez-nous un e-mail à info@kalufs.se pour une conversation informelle sur vos besoins.

À lire avant de décider

Différentes raisons
de prendre le contrôle.

Des articles sur des questions durables, mis à jour sur place à mesure que les sujets évoluent.

Votre vie privée

Nous respectons votre vie privée. Nous n'utilisons aucun cookie d'analyse et ne vous suivons pas à travers les sites. Nous utilisons Plausible Analytics uniquement pour comprendre le trafic agrégé du site, comme le nombre de visiteurs et les zones géographiques générales. Nous respectons Do Not Track et Global Privacy Control.