Pour les applications d'IA
Livrez des applications d'IA sans gérer de GPU
Exécutez API d'inférence, agents et longues tâches en arrière-plan sur une seule plateforme, avec un autoscaling qui suit les pics de trafic.
- 1@task(retries=3, timeout='15m')
- 2async def answer(question):
- 3 docs = await search(question)
- 4 reply = await llm.run(question, docs)
- 5 await save_trace(question, reply)
- 6 return reply
Des équipes d'IA en production
Du notebook prototype à l'agent en production
Le plus difficile dans une application d'IA, c'est tout ce qui entoure l'appel au modèle. Cette partie est intégrée.
Des tâches qui durent plus qu'une requête
Embeddings, résumés et boucles d'agent tournent en tâches en arrière-plan, avec reprises et points de contrôle.
Un trafic qui arrive par vagues
Les API d'inférence montent en charge selon la file d'attente ou le CPU, puis redescendent après le pic.
Des vecteurs à côté de vos données
Postgres managé avec recherche vectorielle réunit embeddings, utilisateurs et métadonnées.
Des clés qui restent privées
Les clés de vos fournisseurs de modèles sont des variables d'environnement chiffrées, et les workers communiquent sur un réseau privé.
Code
Un agent et son worker dans une seule config
Déclarez l'API, le worker et la base de données ensemble. Chaque push déploie les trois.
- Réponses en streaming depuis les services web
- Reprises et délais par tâche
- Traces stockées à côté de vos données
1
services:
2
- type: web
3
name: agent-api
4
runtime: python
5
startCommand: uvicorn app:api
6
autoscaling:
7
minInstances: 1
8
maxInstances: 12
9
targetCPUPercent: 65
10
- type: worker
11
name: agent-worker
12
runtime: python
13
startCommand: python -m worker
14
databases:
15
- name: agent-db
16
extensions: [vector]
1
from cloud.tasks import task
2
3
@task(retries=3, timeout="15m")
4
async def index_document(doc_id: str):
5
doc = await fetch_document(doc_id)
6
chunks = split(doc.text, size=800)
7
vectors = await embed(chunks)
8
await db.save_vectors(doc_id, vectors)
1
$ cloud deploy
2
✓ agent-api en ligne · 2 instances
3
✓ agent-worker en ligne · 1 instance
4
✓ agent-db prête · vector activé
Modèles
Partez d'une stack d'IA qui fonctionne
Forkez un modèle où le worker, la base de données et l'API sont déjà reliés.
- BackendService FastAPIAPI Python typée avec tâches en arrière-plan et migrations.PythonRedisDéployer
- IAAgent de chat IAAgent conversationnel en streaming avec appels d'outils et mémoire durable.PythonWorkflowsDéployer
- BackendMicroservice GoService HTTP léger avec réseau privé.GogRPCDéployer
- IAPipeline RAGWorker d'ingestion de documents avec recherche vectorielle.WorkersPostgresDéployer
Histoire client
Quatre ingénieurs, un million de tâches par jour
Une startup d'IA fait tourner ses API d'inférence et ses tâches en arrière-plan sans équipe ops dédiée.
“Faire tourner nos workers IA ici a permis à une équipe de quatre personnes d'absorber une charge pour laquelle nous pensions en avoir besoin de quinze.”
- Tâches par jour
- M
- Vectorisation, synthèse et indexation de documents.
- Ingénieurs
- Pour toute la plateforme, astreinte comprise.
FAQ
Les applications d'IA sur la plateforme
Les questions que posent les équipes avant de passer un produit d'IA en production.
Parler à un ingénieur01Exécutez-vous les modèles ?
Non. Vos services appellent le fournisseur de modèles de votre choix, ou un modèle hébergé dans votre propre service. La plateforme gère tout autour de l'appel : API, workers, stockage et réseau.
02Combien de temps une tâche en arrière-plan peut-elle tourner ?
Chaque tâche fixe son propre délai, jusqu'à plusieurs heures. Les points de contrôle permettent de reprendre une longue tâche après un déploiement ou une étape en échec, sans repartir de zéro.
03Puis-je diffuser les réponses en streaming vers le navigateur ?
Oui. Les services web gèrent les réponses en streaming et les connexions longues, pour que les tokens arrivent dès que le modèle les renvoie.