v1.0

Architecture Technique Syngulia

Topologie · Modèles · Coûts · Performances

Topologie multi-VPS

VPSRôleHostRAMCPUStockageCoût/mois
s0Hal 🧠Hostinger KVM416 Go4 vCPU200 Go NVMe~20 €
s1QG Rémy 🔒OVH VPS24 Go8 vCPU200 Go NVMe~22 €
s2Boss 👔Hostinger KVM416 Go4 vCPU200 Go NVMe~30 €

Offre locale (HP Portable)

ComposantSpécification
CPUIntel Core Ultra 7 155H — 16c (6P+8E+2LPE), 22 thr, 4.8 GHz
RAM30 Go
GPUIntel Arc Graphics (Meteor Lake) + NPU
Stockage92 Go sys + 769 Go data (452 Go libre)
Ollamav0.32.3 — 25 modèles, 218 Go

Services par VPS

s0 — Hal 🧠

s1 — QG Rémy 🔒

s2 — Boss 👔 (clients)

Stratégie IA — 3 niveaux

NiveauUsageCoût
🟢 Local CPU (s0)Tâches quotidiennes, test, prototypage0 €/mois
🟡 API DeepSeek V4 FlashCerveau Hermes — réflexion, code, plans~0,36 €/mois
🔴 GPU pod Scaleway (L4/L40S/H100)Vidéo, fine-tuning, gros modèles0,79-3 €/h

Modèles IA disponibles

ModèleTailleType🇫🇷t/s (HP)Usage
gemma4:26b16.8 GoMoE 4B actif~12Rédaction, relecture, qualité max
gemma3:4b3.1 GoDense 4B⚠️~18Chat rapide, léger
Mistral Small 3.2 24B~15 GoDense 24B~3.5Code, raisonnement
phi4-mini2.3 GoDense 4B~15Technique, code
qwen2.5-coder:7b4.4 GoDense 7B~7Code + français
glm-4.7-flash17.7 GoDense~13Code, logs, Docker
luciole:23B13.5 GoDense 23B~3.2Français natif
llama3.2:3b1.9 GoDense 3B~20Ultra-rapide

Performance gemma4:26b (référence)

Offload GPU

Fournisseurs Cloud

FournisseurUsageDatacenter FranceGPU
OVHclouds1 (QG)✅ Oui
Hostingers0 (Hal), s2 (Boss)✅ Paris
ScalewayGPU pods, API LLM✅ Paris✅ L4/L40S/H100
HetznerAlternative❌ Allemagne

Bots Telegram

Secrets

Leçons benchmark

  1. think: false au niveau RACINE du payload Ollama (pas dans options)
  2. Pas de num_predict pour les modèles à raisonnement
  3. num_thread=8 sur Ultra 7 155H (règle: P_cores × 1.3)
  4. keep_alive=0 entre modèles, pas entre tests d'un même modèle
  5. Timeout 150s par test
  6. CSV: hostname_YYYY.MM.DD_HHmm_modele.csv

Profils Hermes

© 2026 Syngulia · v1.0