Pour les applications d'IA

Livrez des applications d'IA sans gérer de GPU

Exécutez API d'inférence, agents et longues tâches en arrière-plan sur une seule plateforme, avec un autoscaling qui suit les pics de trafic.

agent.py
  1. 1@task(retries=3, timeout='15m')
  2. 2async def answer(question):
  3. 3 docs = await search(question)
  4. 4 reply = await llm.run(question, docs)
  5. 5 await save_trace(question, reply)
  6. 6 return reply

Des équipes d'IA en production

Du notebook prototype à l'agent en production

Le plus difficile dans une application d'IA, c'est tout ce qui entoure l'appel au modèle. Cette partie est intégrée.

  • Des tâches qui durent plus qu'une requête

    Embeddings, résumés et boucles d'agent tournent en tâches en arrière-plan, avec reprises et points de contrôle.

  • Un trafic qui arrive par vagues

    Les API d'inférence montent en charge selon la file d'attente ou le CPU, puis redescendent après le pic.

  • Des vecteurs à côté de vos données

    Postgres managé avec recherche vectorielle réunit embeddings, utilisateurs et métadonnées.

  • Des clés qui restent privées

    Les clés de vos fournisseurs de modèles sont des variables d'environnement chiffrées, et les workers communiquent sur un réseau privé.

Code

Un agent et son worker dans une seule config

Déclarez l'API, le worker et la base de données ensemble. Chaque push déploie les trois.

  • Réponses en streaming depuis les services web
  • Reprises et délais par tâche
  • Traces stockées à côté de vos données
Démarrage rapide IA
          
            
                1
                services:
              
                2
                  - type: web
              
                3
                    name: agent-api
              
                4
                    runtime: python
              
                5
                    startCommand: uvicorn app:api
              
                6
                    autoscaling:
              
                7
                      minInstances: 1
              
                8
                      maxInstances: 12
              
                9
                      targetCPUPercent: 65
              
                10
                  - type: worker
              
                11
                    name: agent-worker
              
                12
                    runtime: python
              
                13
                    startCommand: python -m worker
              
                14
                databases:
              
                15
                  - name: agent-db
              
                16
                    extensions: [vector]
              
          
        

Histoire client

Quatre ingénieurs, un million de tâches par jour

Une startup d'IA fait tourner ses API d'inférence et ses tâches en arrière-plan sans équipe ops dédiée.

“Faire tourner nos workers IA ici a permis à une équipe de quatre personnes d'absorber une charge pour laquelle nous pensions en avoir besoin de quinze.”
Sofia LindqvistVP Produit, Summit CloudLire l'étude de cas
Tâches par jour
M
Vectorisation, synthèse et indexation de documents.
Ingénieurs
Pour toute la plateforme, astreinte comprise.
Lire les études de cas

FAQ

Les applications d'IA sur la plateforme

Les questions que posent les équipes avant de passer un produit d'IA en production.

Parler à un ingénieur
01Exécutez-vous les modèles ?

Non. Vos services appellent le fournisseur de modèles de votre choix, ou un modèle hébergé dans votre propre service. La plateforme gère tout autour de l'appel : API, workers, stockage et réseau.

02Combien de temps une tâche en arrière-plan peut-elle tourner ?

Chaque tâche fixe son propre délai, jusqu'à plusieurs heures. Les points de contrôle permettent de reprendre une longue tâche après un déploiement ou une étape en échec, sans repartir de zéro.

03Puis-je diffuser les réponses en streaming vers le navigateur ?

Oui. Les services web gèrent les réponses en streaming et les connexions longues, pour que les tokens arrivent dès que le modèle les renvoie.

Commencer

Déployez votre premier agent aujourd'hui

Installez la CLI, liez un dépôt, et votre API et votre worker passent en ligne ensemble.

Installez la CLI
npm install -g @cloud/cli
Buy NowTheme Details