Flux à base de silicium
Plateforme d’infrastructure IA nationale offrant l’inference multimodèle, les appels API et des services de puissance de calcul
Étiquettes :Modèle d’entraînement d’IAQu’est-ce que le flux à base de silicium ?
SiliconFlow est une entreprise qui fournit une infrastructure pour l’inference des grands modèles ainsi qu’une plateforme MaaS de niveau entreprise. Son produit cloud public destiné aux développeurs s’appelle SiliconCloud. Il regroupe sur une plateforme unifiée les modèles linguistiques, visuels, de génération d’images, vocaux, d’incorporation, de réordonnancement et vidéo provenant de différents fabricants et communautés open source ; une fois qu’un utilisateur a créé une clé API, il peut les utiliser en fonction de ses besoins.
Contrairement aux fournisseurs qui ne proposent qu’un seul modèle développé en interne, SiliconCloud ressemble davantage à un cloud de raisonnement multi-modèles. Les développeurs peuvent comparer les prix des modèles, le contexte, les appels d’outils, les fonctionnalités visuelles, le processus de raisonnement et la vitesse au sein du même compte et du même système d’interfaces, puis choisir le modèle adapté à leurs besoins, sans avoir à acheter eux-mêmes des GPU, déployer des poids de modèle ni gérer des clusters de raisonnement.
Appel unifié de plus de 100 modèles
Le centre des modèles actuels présente plus de 100 modèles populaires, couvrant DeepSeek, Qwen, GLM, Kimi, MiniMax, Hunyuan, Step, Baichuan ainsi que des projets de la communauté open source. Les types incluent la conversation, le code, la compréhension visuelle, la génération et l’édition d’images, la reconnaissance vocale, la synthèse vocale, les Embedding, le Rerank et la génération de vidéos.
Chaque page de modèle indique l’ID du modèle, la longueur du contexte, la taille des paramètres, les coûts d’entrée et de sortie ainsi que les capacités de support. L’ID complet du modèle doit être utilisé lors de l’appel ;
Un même modèle peut comporter à la fois des lignes ordinaires et des lignes à haute fiabilité commençant par Pro ; leurs prix, leur capacité de traitement simultané et leur qualité de service peuvent varier.
API compatible OpenAI
SiliconCloud propose une interface compatible avec OpenAI ; les SDK courants d’OpenAI ainsi que les applications prenant en charge une URL de base personnalisée peuvent être migrées en remplaçant uniquement l’adresse de l’interface, la clé API et l’ID du modèle. La documentation officielle indique également comment configurer des outils tels que Kilo Code, Cherry Studio, Dify, LangChain, LlamaIndex, Refly, etc.
La compatibilité ne signifie pas que les paramètres de tous les fabricants soient identiques. Le contenu du raisonnement, les appels d’outils, les entrées multimodales, les sorties en flux et le champ du nombre maximal de tokens varient en fonction du modèle ;
Avant le lancement, il convient de lire la description des capacités de lecture du modèle cible et de gérer les paramètres non pris en charge, ainsi que les changements dans la structure de sortie en cas de désactivation du modèle.
Modèles de dialogue et de raisonnement
L’interface de dialogue prend en charge les conversations ordinaires, les textes longs, le code, le raisonnement, la sortie en flux ainsi que l’appel de fonctions pour certains modèles. Les modèles de raisonnement retournent généralement le contenu de leur réflexion dans un champ distinct reasoning_content ; le côté application doit gérer le contexte sur plusieurs tours conformément aux spécifications officielles, afin d’éviter d’envoyer à nouveau intégralement un historique de raisonnement trop long.
Les capacités des modèles diffèrent considérablement : certains conviennent à la classification et à l’extraCTION d’extraits à faible coût, d’autres mettent l’accent sur le code et les appels d’outils d’Agent, tandis que d’autres prennent en charge le contexte visuel et très long. Il ne faut pas choisir uniquement en fonction de la taille des paramètres ; il convient également de comparer la précision, le délai du premier token, le délai total, le contexte, la limite de sortie et le prix.
Vision, images et vidéos
Les modèles de dialogue multimodal peuvent recevoir des entrées sous forme d’images ou de vidéos ; les modèles d’images permettent la génération d’images à partir de texte ainsi que l’édition d’images, tandis que les modèles vidéo sont facturés en fonction des résultats générés. L’interface de génération renvoie généralement une adresse de fichier valable pour une courte période ; les autorités ont précisé que les adresses des résultats en image et en vidéo ne restent valides qu’environ 1 heure, et l’application doit les télécharger immédiatement et les stocker dans son propre système de stockage objet.
La génération d’images et de vidéos est également influencée par la taille, la durée, le modèle, la concurrence et les politiques de sécurité du contenu. Les tâches asynchrones doivent conserver l’ID de la demande, surveiller l’état des requêtes en boucle et gérer les remboursements en cas d’échec ou les tentatives de réessai ; il ne faut pas considérer l’adresse des résultats temporaires comme un lien vers du matériel permanent.
Voix, Embedding et Reranking
La plateforme prend en charge la reconnaissance vocale, la synthèse vocale et des modèles de dialectes, et propose également divers modèles d’Embedding ainsi que de Reranking en chinois et en anglais. Les Embedding servent à convertir le texte en vecteurs, tandis que les Rerank permettent de réordonner les résultats de recherche ; il s’agit d’une combinaison courante dans les bases de connaissances et les systèmes RAG.
Le centre de modèles conserve actuellement plusieurs modèles gratuits d’Embedding, de Reranking, d’OCR, de traduction et de reconnaissance vocale. Le fait qu’ils soient gratuits ne signifie pas des requêtes illimitées ; il peut y avoir des contraintes en termes de concurrence, de vitesse, de file d’attente, ainsi que des changements futurs vers un modèle payant.
Le système de production doit disposer d’un modèle de secours payant.
Modèle de prix actuel
| Forfait ou version | Prix, plafonds et avantages clés |
|---|---|
| GLM-5.2 | Entrée : 8 yuans, sortie : 28 yuans par million de tokens. |
| DeepSeek-V4-Flash | Entrée : 1 yuan, sortie : 2 yuans par million de tokens. |
| DeepSeek-V3.2 | Entrée : 4 yuans, sortie : 6 yuans par million de tokens. |
| Qwen3.5-35B-A3B | Dans un contexte de 128 K, 0,40 yuan pour l’entrée et 3,20 yuan par million de tokens pour la sortie. |
| Modèle d’image | Il est généralement de 0,10 à 0,30 yuan par pièce, certains modèles sont gratuits. |
| MOSS-TTSD et CosyVoice2 | Prix indicatif : 0,05 yuan par millier de caractères UTF-8. |
| Vidéo Wan2.2 | Les prix d’exemple pour la génération de vidéo à partir de texte et de image sont de 2 yuans par exemple. |
SiliconCloud ne dispose pas de tarif mensuel unique pour ses abonnements ; il repose principalement sur des crédits prépayés complétés par des frais proportionnels à l’utilisation. Le modèle de dialogue calcule séparément les coûts d’entrée, de sortie et de hits de cache par million de tokens.
Les images sont facturées par pièce, les voix par millier de caractères ou selon les règles du modèle, et les vidéos par unité.
Les prix varient beaucoup selon les modèles.
Jusqu’à cette vérification, les exemples de centres de prix sont les suivants : GLM-5.2 avec un coût d’entrée de 8 yuans et un coût de sortie de 28 yuans par million de tokens ; DeepSeek-V4-Flash avec un coût d’entrée de 1 yuan et un coût de sortie de 2 yuans.
DeepSeek-V3.2 : 4 yuans pour l’entrée, 6 yuans pour la sortie ; Qwen3.5-35B-A3B : 0,40 yuan pour l’entrée jusqu’à 128K, 3,20 yuan pour la sortie.
Les modèles de contexte long peuvent appliquer des tarifs plus élevés une fois le seuil dépassé.
Les modèles de génération d’images coûtent actuellement en moyenne de 0,10 à 0,30 yuan par image, certains modèles étant gratuits ; les exemples MOSS-TTSD et CosyVoice2 coûtent 0,05 yuan par millier de caractères UTF-8.
Les exemples de génération de vidéo à partir de texte Wan2.2 et de génération de vidéo à partir d’image coûtent 2 yuans chacun. Les prix sont ajustés fréquemment ; pour un budget officiel, il est nécessaire de consulter le prix en temps réel sur le centre de prix concernant le modèle cible, plutôt que de s’appuyer sur des captures d’écran de l’article.
Modèles gratuits et solde offert
Le centre de prix de la plateforme met en évidence certains modèles comme étant gratuits, tels que plusieurs modèles d’Embedding, de Rerank, d’OCR, de traduction, de traitement du langage parlé et d’images. Ces modèles gratuits conviennent aux essais, à l’enseignement et au RAG à faible coût, mais leur disponibilité, leurs délais et leurs stratégies d’allumage/éteignement ne répondent pas nécessairement aux SLA de production.
De nouveaux utilisateurs, les invités et les participants à des campagnes promotionnelles peuvent recevoir un solde offert, mais le contrat officiel de rechargement ne prévoit pas un montant d’inscription fixe. Le solde offert ne peut être retiré, ni transféré, ni facturé ; sa durée de validité et son champ d’application sont déterminés par les règles de l’événement. Par conséquent, il ne faut pas considérer les montants offerts lors de l’inscription dans le passé comme un avantage permanent.
Rechargement, solde et remboursement
Avant de recharger en ligne, il est nécessaire de procéder à une vérification de l’identité. Actuellement, la méthode de paiement en ligne indiquée dans le contrat de recharge est WeChat Pay. Le montant payé constitue un solde de recharge qui n’a pas de date d’expiration, mais ne peut être ni transféré ni offert à autrui.
Le montant offert est géré séparément.
Dans les 360 jours suivant la recharge par paiement en ligne, le solde non consommé peut faire l’objet d’un remboursement automatique soumis à vérification, des frais pouvant être appliqués ; les montants déjà consommés ainsi que le solde offert ne sont pas remboursables.
En principe, un seul remboursement est autorisé par rechargement en ligne, et les virements professionnels doivent faire l’objet d’une demande auprès du service d’assistance.
Factures et quittances
La console fournit une facture des frais, permettant de consulter la consommation par modèle et par appel. Seule la somme réellement consommée peut faire l’objet d’une facturation ; le solde rechargé mais non consommé ne peut pas être facturé.
Un solde offert ne peut pas non plus faire l’objet d’une facture.
L’authentification personnelle ne permet de délivrer que des factures ordinaires personnelles, tandis que l’authentification d’entreprise permet de demander des factures émises par l’entreprise conformément aux règles.
Les projets de production doivent diviser la consommation en fonction de la clé API, de l’environnement ou du domaine d’activité, et définir des alertes de solde. Il ne faut pas que les tests, le développement et la production partagent la même clé, car cela rend difficile le suivi des appels anormaux et la répartition des coûts.
Sécurité de la clé API
La clé API dispose des droits d’utilisation du compte et doit être stockée dans une variable d’environnement du serveur ou dans un système de gestion de clés, et ne doit pas être inscrite dans le front-end d’un site web, dans les fichiers d’installation d’une application mobile, dans des captures d’écran ou dans des dépôts de code publics. En cas de fuite, elle doit être supprimée immédiatement et recréée.
Il est recommandé de créer une clé distincte par application, d’activer la surveillance des coûts et les journaux des requêtes, tout en évitant d’enregistrer les prompts sensibles originaux des utilisateurs. Si le client doit effectuer des appels via Internet, il doit d’abord accéder à son propre backend, qui transmettra ensuite les requêtes à SiliconCloud.
Limitation du débit et concurrence
La plateforme définit des limites de RPM, TPM, RPH, RPD ou de concurrence en fonction du modèle, de la ligne, de l’état du compte et de la charge en temps réel ; les annonces officielles ajustent également les stratégies en fonction des ressources disponibles. Les modèles gratuits et les nouveaux modèles populaires sont plus susceptibles d’être mis en file d’attente ou de déclencher des limites de débit.
Pour faire face aux erreurs 429, de délai et de service, il convient d’appliquer un recul exponentiel, des mécanismes de coupure, ainsi que des files d’attente et des modèles de secours ; on ne peut pas supposer qu’une requête aboutira nécessairement. Pour des besoins de production à forte concurrence, il est possible de choisir l’option Pro ou de contacter les services entreprises pour obtenir une concurrence et des SLA personnalisés.
Ajustement du modèle
La console SiliconCloud offre un point d’accès pour le fine-tuning des modèles, avec une facturation distincte pour l’entraînement et le déductions après fine-tuning. Une fois le modèle de base sélectionné, la page affiche le prix correspondant à l’entraînement et celui du déductions.
Le réglage fin est adapté aux formats fixes, aux expressions sectorielles et à l’optimisation des comportements de tâche, mais il n’est pas adapté à l’insertion en temps réel de connaissances qui changent fréquemment.
Avant de télécharger les données d’entraînement, il convient de supprimer les informations personnelles, les secrets clients et tout contenu non autorisé, et de conserver l’ensemble de validation pour vérifier le surapprentissage. Dans les scénarios où la mise à jour des connaissances est fréquente, RAG et Embedding devraient généralement être privilégiés.
MaaS au niveau entreprise et privatisation
Le MaaS au niveau entreprise couvre la gestion de ressources de calcul hétérogènes, l’entraînement de modèles, le déploiement pour l’inference, le fine-tuning, la surveillance et le recyclage des ressources, et peut s’adapter à diverses architectures ainsi qu’à des puces locales. Les domaines visés sur le site officiel incluent les centres de calcul intelligent, l’énergie, la fabrication, les transports et les opérateurs.
Pour les entreprises qui ne souhaitent pas sortir de leur domaine de données sensibles, disposent déjà d’une GPU ou de ressources de calcul nationales, et ont besoin de performances spécialisées ainsi que de contrôles de conformité, il est possible de consulter la possibilité d’un déploiement localisé. Les solutions destinées aux entreprises sont proposées à un tarif sur mesure ; le contrat doit préciser l’adaptation du matériel, les licences des modèles, les mises à jour, les SLA, les évaluations de sécurité et les limites de maintenance.
OneDiff et accélération du raisonnement
OneDiff est une bibliothèque open source officielle basée sur le silicium pour accélérer les modèles de diffusion, conçue pour optimiser l’inference des modèles génératifs tels que Stable Diffusion. Elle relève d’un niveau différent de l’API Cloud SiliconCloud : la première est un projet d’accélération que les développeurs peuvent déployer, tandis que la seconde est un service de hébergement de multiples modèles.
L’utilisation de OneDiff exige encore que l’on prépare soi-même la GPU, les poids du modèle et l’environnement de exécution, tout en respectant les licences de chaque modèle. Il ne peut pas copier localement tous les modèles commerciaux, systèmes de planification et consoles d’entreprise de SiliconCloud.
BizyAir et ComfyUI
BizyAir propose des nœuds ComfyUI qui permettent d’utiliser les capacités de génération en cloud dans un environnement sans GPU local. Il est idéal pour intégrer les modèles SiliconCloud dans des flux d’image basés sur des nœuds, et les combiner avec d’autres nœuds ComfyUI.
Les nœuds cloud consomment le solde de la plateforme, et la génération de données passe par les services cloud. Lorsqu’il s’agit de matériel non public, de portraits de personnes et de fichiers clients, il convient de se référer à la politique de traitement des données ; on ne doit pas supposer que tous les nœuds s’exécutent localement simplement parce que ComfyUI est lui-même open source.
GitHub et l’état open source
L’organisation officielle GitHub basée sur le silicium a rendu publics des nœuds liés à OneDiff, BizyAir, siliconcloud-cookbook, ComfyUI, ainsi que plusieurs projets d’ingénierie, et gère également des forks de certains projets sources. Les licences de chaque répertoire diffèrent ; il convient de les vérifier une par une.
La plateforme cloud SiliconCloud, ainsi que les services de routage de modèles unifiés, de facturation, d’ordonnancement et d’inference complète ne sont pas entièrement open source. Par conséquent, la description exacte doit être : « La plateforme cloud n’est pas open source, mais plusieurs projets open source sont fournis officiellement », et on ne peut pas prétendre que l’ensemble de SiliconCloud puisse être privatisé gratuitement.
Guide d'utilisation du flux à base de silicium
Terminer une tâche de base
- Inscrivez le flux basé sur le silicium et créez une clé API réservée uniquement à l’environnement de test ;
- Sélectionner le modèle en fonction du type d’entrée, du contexte, de la qualité, de la vitesse et du prix ;
- Appeler d’abord plus de 100 modèles pour effectuer une requête minimale et vérifier la structure de réponse ;
- Tester ensuite la sortie en flux, les paramètres et les réponses aux exceptions à l’aide de modèles de dialogue et de raisonnement ;
- Enregistrer les tokens, le nombre d’appels, le délai, le taux d’erreurs et le coût par appel ;
- Transférez la clé dans le gestionnaire de clés du serveur avant de l’intégrer à l’application officielle ;
Créer des flux de travail professionnels réutilisables
- Utiliser des clés et des quotas différents pour les environnements de développement, de test et de production ;
- Appel unifié selon plus de 100 modèles, création d’ensembles d’évaluation représentatifs pour les modèles de dialogue et de raisonnement ainsi que pour l’vision, les images et les vidéos ;
- Définir les délais d’attente, la concurrence, les tentatives de réessai, le throttling et les plafonds budgétaires ;
- Effectuer des vérifications sur la sortie en ce qui concerne les faits, la sécurité, le format et les informations sensibles ;
- Surveiller les changements de version, de prix, de délai et de taux d’échec des modèles de surveillance ;
- Préparer des plans de dégradation du modèle, de coupure et de prise en main manuelle ;
À qui s’adresse-t-il ?
- Développeurs qui souhaitent comparer et basculer rapidement entre des grands modèles nationaux et open source à l’aide d’une API ;
- Équipes pour développer des applications de chat, de code, d’agents, de RAG, d’images, de voix ou de vidéo ;
- Les startups et les développeurs indépendants qui ne souhaitent pas mettre en place leur propre cluster d’inférence GPU ;
- Projets de bases de connaissances nécessitant des capacités d’Embedding, de Reranking et multimodales ;
- Les entreprises ayant besoin d’une puissance de calcul locale, d’un MaaS adapté au marché national et de services exclusifs.
Avantages du produit
- Les comptes unifiés et les API couvrent plus de 100 modèles ;
- Compatibilité avec l’écosystème OpenAI, faible seuil d’entrée pour la migration et la configuration d’outils tiers ;
- Couvrant en même temps le texte, l’élément visuel, les images, la voix, les vecteurs, le réordonnancement et la vidéo ;
- Facturation à l’usage avec plusieurs modèles gratuits disponibles ;
- Fournir le fine-tuning de modèles, la version Pro et la privatisation MaaS pour les entreprises ;
- Les responsables maintiennent des projets open source tels que OneDiff, BizyAir et Cookbook.
Restrictions et précautions
- La liste des modèles, les prix, les versions et les restrictions de trafic changent fréquemment ; les anciens modèles peuvent être retirés ou mis à jour sans interruption vers de nouvelles versions.
- Les applications qui dépendent fortement du comportement de sortie doivent fixer l’ID du modèle, mettre en place des tests de régression et le valider après la publication des mises à jour.
- L’API de agrégation ne élimine pas les illusions inhérentes au modèle, ni les risques liés aux droits d’auteur, à la sécurité et à la conformité.
- Les lignes gratuites ne garantissent pas une stabilité à long terme ;
- L’adresse temporaire du fichier généré doit être sauvegardée en temps opportun ;
- La fuite de clés peut entraîner une perte de solde ;
- Les applications médicales, juridiques, financières et gouvernementales doivent renforcer la vérification manuelle et les contrôles de sécurité sectoriels ;
Questions fréquentes
Le flux basé sur le silicium est-il gratuit ?
La plateforme est facturée à l’usage, mais le centre de modèles propose plusieurs modèles gratuits, et des promotions peuvent également offrir des crédits gratuits. Les modèles gratuits et les crédits offerts varient ; cela ne signifie pas que tous les modèles sont gratuits.
Combien coûte l’API de flux basée sur le silicium ?
Il n’y a pas de prix unitaire fixe. La communication est facturée en fonction des tokens entrants, sortants et en mémoire tampon ; actuellement, le tarif varie de quelques dizaines de centimes par million de tokens à plusieurs dizaines de yuans.
Les images coûtent généralement à partir de 0,10 yuan, et certaines vidéos environ 2 yuan chacune ; il est nécessaire de consulter le centre des prix des modèles en temps réel.
Le flux basé sur le silicium est-il compatible avec l’API d’OpenAI ?
Il est compatible avec les interfaces et configurations SDK couramment utilisées par OpenAI, mais l’inference, le multimodal, les appels d’outils et les paramètres spécifiques aux modèles doivent encore être adaptés conformément à la documentation officielle.
Le solde rechargé expire-t-il ?
Le solde de rechargement effectivement payé n’a pas de date d’expiration ; le solde offert est géré conformément aux règles de l’offre.
Un remboursement pour le solde non consommé des paiements en ligne peut être demandé et examiné dans un délai de 360 jours suivant le rechargement.
Le flux basé sur le silicium est-il open source ?
La plateforme cloud principale SiliconCloud n’est pas open source, mais les projets officiels open source tels que OneDiff, BizyAir et Cookbook le sont. Un dépôt open source ne signifie pas pour autant qu’une plateforme cloud complète puisse être hébergée en interne.
Numéro d’enregistrement de sécurité publique du Guangxi : 45132202000164