Together AI
Kostenloser Mehrwert
Komplette Liste an KI-Tools KI-Trainingsmodelle

Together AI

Eine AI-native Cloud-Plattform, die Open-Source-Modelle für Inferenz und Feinabstimmung sowie spezielle Rechenkapazitäten bietet.

Tags:

Was ist Together AI?

Together AI ist eine AI-Infrastrukturplattform für Entwickler und Unternehmen, die API-Dienste für große Sprachmodelle, Bilder, Videos, Sprache, Embeddings sowie Sicherheitsmodelle anbietet. Nutzer können mit serverloser Inferenz beginnen und je nach Bedarf auf Provisioned Throughput, Dedicated Inference oder GPU Cluster upgraden.

Die Plattform konzentriert sich auf Open-Source-Modelle sowie Modelle mit offenen Gewichten und bietet zudem Modelloben, Batch-APIs, Code-Sandboxes sowie hochleistungsfähige Speicherlösungen. Entwickler können mithilfe der REST-, Python- oder TypeScript-SDKs die Modelle in Chat-, Such-, Agenten- und Inhaltserstellungsanwendungen integrieren.

Hauptfunktionen von Together AI

  • Serverless Inference:Es ist kein Management der GPU erforderlich; die Abrechnung erfolgt nach tatsächlichem Verbrauch an Tokens, Bildern, Videos oder Audio.
  • Modellverzeichnis:Text-, Inferenz-, Code-, visuelle und multimodale Modelle von verschiedenen Herstellern werden bereitgestellt.
  • OpenAI-kompatible Schnittstelle:Senkung der Kosten für die Migration bestehender Chats und Completion-Apps.
  • Batch API:Asynchrone Verarbeitung großer Mengen an nicht-echtzeitigen Anfragen, geeignet für Offline-Aufgaben.
  • Caching-Eingabe:Unterstützung der Prompt-Caching-Preise für bestimmte Modelle, um die Kosten für wiederholten Kontext zu senken.
  • Provisioned Throughput:Eine feste Durchsatzleistung wird über PTU reserviert, was sich für einen stabilen hohen Datenverkehr eignet.
  • Dedicated Inference:Modelle auf Single-Tenant-GPUs ausführen, um eine stabile Leistung und bessere Kontrolle zu erzielen.
  • GPU Clusters:Verwenden Sie für die GPU-Stunden H100, H200, B200 und ähnliche Rechenleistung.
  • Fine-tuning:Unterstützt Trainingsmethoden wie SFT, LoRA, vollständige Feinabstimmung und Präferenzoptimierung.
  • Bilder und Videos:Mehrere Erstellung-, Bearbeitungs- und Multimedia-Modelle über ein einheitliches API aufrufen.
  • Code Sandbox:Es stellt eine isolierte Ausführungsumgebung zur Erstellung von Code für Agenten oder Modelle bereit.
  • Offizielle SDKs und Cookbooks:Es werden Beispiele für Python, TypeScript und wiederverwendbare Agenten bereitgestellt.

Vergleich der Methoden zur Implementierung von Schlussfolgerungen

MethodeAbrechnungsmethodePassende Szenarien
ServerlessNach Token oder Medien-Generierungs-EinheitenTeste, schwankender Durchfluss und schnelle Inbetriebnahme
Batch APIAsynchrone Batch-PreiseOffline-Klassifizierung, Zusammenfassung, Bewertung und Datenverarbeitung
Provisioned ThroughputNach PTU pro MinuteStabile hohe Durchsätze und vorhersehbarer Durchsatz
Dedicated InferenceStunden GPU pro Mieter nach BestellungMaßgeschneiderte Modelle, stabile Verzögerungen und Isolierungsanforderungen
GPU ClusterNach GPU-Stunden und ReservierungszeitraumTraining, Schlussfolgerung ziehen, benutzerdefinierte Arbeitslasten und Forschung

Beispiele für Preise des Serverless-Textmodells

Die untenstehende Tabelle zeigt die Referenzpreise, die bei der Überprüfung auf der offiziellen Preisseite herangezogen werden. Die Angaben sind in US-Dollar pro 1 Million Tokens. Da sich die Preise für das Modell sowie die Einzelpreise häufig ändern, sollte die Preisseite vor jeder tatsächlichen Nutzung erneut überprüft werden.

ModellEingabeCaching der EingabenAusgabe
MiniMax M30,30 US-Dollar0,06 US-Dollar1,20 Dollar
GLM-5.21,40 Dollar0,26 US-Dollar4,40 US-Dollar
Kimi K33,00 US-Dollar0,30 US-Dollar15,00 US-Dollar
DeepSeek V4 Flash 07310,14 US-Dollar0,03 US-Dollar0,28 US-Dollar
gpt-oss-120B0,15 US-DollarNicht gesondert aufgeführt0,60 US-Dollar
Llama 3.3 70B1,04 US-DollarNicht gesondert aufgeführt1,04 US-Dollar
gpt-oss-20B0,05 US-DollarNicht gesondert aufgeführt0,20 US-Dollar

Die Eingangs- und Ausgangspreise sind nur die Grundkosten; Agent-Zyklen, lange Kontexte, Tool-Ergebnisse sowie wiederholte Vorgänge erhöhen die Anzahl der Tokens. Modelle mit gespeicherten Preisen erhalten einen entsprechenden Rabatt nur dann, wenn die Anfrage den Cache-Regeln entspricht.

Preise für Dedicated und GPU Cluster

Die folgenden Angaben beziehen sich auf den Referenzpreis in US-Dollar pro Stunde pro GPU nach Bedarf; die Preise für spezielle Inferenzfunktionen sowie Clustern unterscheiden sich. Bei langfristiger Reservierung gelten Staffelrabatte. Die tatsächlich verfügbaren Regionen, der Lagerbestand sowie die Konfigurationen richten sich nach den Angaben in der Konsole.

HardwareDedicated InferenceGPU-Cluster auf AnfrageLangfristige Referenz für Clustern
NVIDIA HGX H1005,49 US-Dollar3,99 Dollar7 bis 30 Tage: 3,69 US-Dollar, 91 bis 180 Tage: 3,19 US-Dollar
NVIDIA HGX H200Kontaktieren Sie den Verkauf5,99 Dollar7 bis 30 Tage: 4,99 US-Dollar, 91 bis 180 Tage: 3,99 US-Dollar
NVIDIA HGX B2008,99 Dollar8,19 US-Dollar7 bis 30 Tage: 7,99 US-Dollar, 91 bis 180 Tage: 6,79 US-Dollar
NVIDIA HGX B300Kontaktieren Sie den VerkaufKontaktieren Sie den VerkaufGemäß Vertrag
NVIDIA GB200 oder GB300 NVL72Kontaktieren Sie den VerkaufKontaktieren Sie den VerkaufGemäß Vertrag

Feinabstimmung und Sandbox-Preise

DienstleistungenReferenzpreisAbrechnungshinweise
Ganztägige Feinabstimmung von SFT bis 16B1,20 DollarJede 1 Million Trainings-Token
SFT LoRA bis 16B1,50 US-DollarJede 1 Million Trainings-Token
Ganze Feinabstimmung von DPO innerhalb von 16B3,75 DollarJede 1 Million Trainings-Token
DPO LoRA bis 16B3,20 DollarJede 1 Million Trainings-Token
Mindestgebühr für Standard-Feinabstimmung4 Dollar/AuftragDie Regeln für bestimmte große Modelle können unterschiedlich sein.
Code Interpreter0,03 US-DollarJede Sitzung dauert maximal 60 Minuten
Sandbox vCPU0,0446 US-Dollar/StundeRessourcen nach Verteilung berechnen
Sandbox-Memory0,0149 US-Dollar/GiB/StundeZusätzlich zu den Kosten für vCPU

Die Anpassungskosten werden aus den Trainingsdatentokens multipliziert mit der Anzahl der Epochen berechnet, wobei optional auch die Anzahl der Validierungs- und Bewertungsdaten hinzugerechnet wird. Für die Inferenz des trainierten Modells, spezielle Endpunkte sowie die Speicherung können zusätzliche Gebühren anfallen.

Erstellung einer API-Key und Anleitung für den ersten Aufruf

  1. Projekt erstellen:Registrieren Sie die Konsole und erstellen Sie ein eigenständiges Entwicklungsprojekt.
  2. Rechnung einstellen:Geld aufladen oder Zahlungsmethoden konfigurieren sowie Budget und Erinnerungen einstellen.
  3. Schlüssel erzeugen:Erstellen Sie einen API-Schlüssel und speichern Sie ihn umgehend in einem sicheren Secrets-System.
  4. SDK installieren:Installieren Sie die offiziellen Python- oder TypeScript-Bibliotheken entsprechend der Technologie-Stack.
  5. Modell auswählen:Vergleichen Sie Kontext, Fähigkeiten, Geschwindigkeit, Lizenzen und den aktuellen Preis pro Einheit.
  6. Kleine Testmengen:Beschränken Sie die maximale Ausgabemenge an Tokens, indem Sie zunächst das Antwortformat, Fehler sowie die fließende Rückgabe überprüfen.
  7. Echtzeit-Überwachung:Protokollieren Sie Token, Verzögerung, Statuscode, Modellversion und Kosten pro Anfrage.

Leitfaden zur Auswahl von Modellen

  1. Verwenden Sie echte Geschäftsbeispiele, um Testsets für Qualität, Verzögerung, Sicherheit und Kosten zu erstellen.
  2. Zuerst werden mit günstigen kleinen Modellen einfache Aufgaben der Klassifizierung, Extraktion und Routenplanung getestet.
  3. Komplexe Schlussfolgerungen, Code oder lange Kontexte – bei größeren Modellen sollte man nicht nur auf die Platzierungen in den Rankings schauen.
  4. Überprüfen Sie die Lizenzbedingungen des Modells, die Richtlinien für die zulässige Nutzung sowie die Anforderungen für eine kommerzielle Implementierung.
  5. Testen Sie JSON, Toolaufrufe, fließende Ausgabe, Konkurrenz und Kontextgrenzen.
  6. Konfigurieren Sie für das Hauptmodell alternative, herabstufbare Optionen und erstellen Sie einen Migrationsprozess für den Ausfall des Modells.
  7. Erstellen Sie eine wöchentliche Statistik der Kosten für erfolgreich abgeschlossene Aufgaben, anstatt nur den Preis pro Million Token zu vergleichen.

Anleitungen zur Feinabstimmung von Modellen

  1. Bestätigung der Notwendigkeit:Zuerst prüfen, ob Prompt, RAG und Toolaufrufe bereits die Anforderungen erfüllen.
  2. Daten vorbereiten:Doppelte Einträge entfernen, Daten anonymisieren und die Eingangs-/Ausgabeformate standardisieren sowie Trainings- und Validierungsdatensätze erstellen.
  3. Auswahlmethode:In der Regel wird zunächst LoRA SFT verwendet; nur bei triftigen Gründen wird an Vollmodell oder DPO gedacht.
  4. Schätzung der Kosten:Berechnen Sie den Trainingsbudget anhand von Daten-Token, Epochs, Anzahl der Validierungen und Mindestgebühr.
  5. Starten Sie die Aufgabe:Laden Sie die Daten hoch und dokumentieren Sie das Basismodell, die Parameter, den Code sowie die Datenversionen.
  6. Unabhängige Bewertung:Überprüfen Sie die Qualität, die Verzerrung und die sichere Regression mit einem Testdatensatz, der nicht am Training teilgenommen hat.
  7. Einsatz der Überwachung:Zuerst wird mit geringer Durchflussmenge veröffentlicht, und dabei werden das feinjustierte Modell kontinuierlich mit dem Basismodell verglichen.

Für welche Nutzer eignet sich Together AI?

  • Entwickler von KI-Anwendungen:Mehrere offene Modelle und Multimedia-Fähigkeiten über ein einheitliches API aufrufen.
  • Agententeam:Kombinierte Inferenz, Werkzeuge, Embedding, Sandbox und Mehr-Modell-Routing.
  • Daten-Team:Verwenden Sie Batch zur großskaligen Klassifizierung, Zusammenfassung und strukturierten Extraktion.
  • Modellteam:Einsatz von SFT, LoRA, DPO und maßgeschneiderten Modellen.
  • Produkte mit hohem Durchfluss:Von Serverless schrittweise auf PTU oder Dedicated Inference upgraden.
  • Forschungseinrichtung:Mieten Sie GPU-Clustern zur Durchführung von Trainings-, Bewertungs- und Inferenzexperimenten.
  • Multimedia-Produkte:Einheitlicher Zugang zu Modellen für Bild-, Video-, Spracherkennung und -synthese.

Vorteile des Produkts

  • Umfasst die vollständigen Ansätze für Serverless, Batch, PTU, Dedicated und GPU Cluster;
  • Es gibt eine breite Auswahl an Modellen, mit denen auf derselben Plattform mehrere offene Modelle verglichen werden können;
  • Unterstützung von Text, Bildern, Videos, Audio, Embedding und Sicherheitsmodellen;
  • Einige Schnittstellen sind mit dem OpenAI-Format kompatibel, wodurch die Kosten für die Migration bestehender Anwendungen gering sind;
  • Bereitstellung von Infrastruktur für Agenten wie Schulung, Feinabstimmung, Code-Sandbox und Speicherung;
  • Die offiziellen Python- und TypeScript-SDKs sowie die Beispiele aus den Cookbooks sind recht umfassend.
  • Die Preistabelle gibt Token, GPU und Trainingseinheiten preis, um Kosten zu schätzen.

Einsatzbeschränkungen und Kostenhinweise

  • Die Kataloge der Modelle sowie die Einzelpreise ändern sich häufig, daher kann ein einmal festgelegter Preis nicht in den langfristigen Haushaltsplan eingetragen werden.
  • Die Fähigkeiten der verschiedenen Modelle in Bezug auf Toolaufrufe, JSON, visuelle Darstellungen und Kontext sind nicht einheitlich.
  • Bei mehrfachen Agentenzyklen wird der Kontext immer wieder übertragen, was die Kosten erheblich erhöhen kann im Vergleich zu einem einzigen Chat.
  • Spezialisierte GPUs werden nach Laufzeit abgerechnet; auch inaktivere Endpunkte können weiterhin Gebühren verursachen.
  • Für Szenarien, in denen Sandbox nicht automatisch beendet wird, sollte ein TTL festgelegt und eine aktive Reinigung vorgenommen werden;
  • Feinabstimmungen können Informationen mit geringer Speicherkapazität beeinträchtigen oder die allgemeinen Fähigkeiten verringern; sie müssen separat bewertet werden.
  • Je nach Modelllizenz gewährt die Aufrufung der API keine automatische unbegrenzte kommerzielle Nutzung.

Empfehlungen zur Datensicherheit und Produktion

  • API-Schlüssel werden ausschließlich auf der Serverseite in den Secrets gespeichert und je nach Projekt und Umgebung separat erstellt.
  • Für Entwicklung, Testing und Produktion werden separate Budgets, Geschwindigkeitsbeschränkungen und Berechtigungen festgelegt;
  • Löschen Sie vor dem Hochladen der Feinabstimmungsdaten persönliche Informationen, Schlüssel und gesperrte Inhalte;
  • Protokollieren Sie die Modell-ID, die Anfragesparameter und die Version, um sicherzustellen, dass das Problem reproduziert werden kann;
  • Für 429, Zeitüberschreitung und Servicefehler werden begrenzte Wiederholungsversuche sowie exponentieller Backoff verwendet;
  • Bei hohem Risiko werden die Inhaltsfilterung, die Überprüfung der Fakten sowie die manuelle Freigabe verstärkt.
  • Regelmäßig ungenutzte Endpunkte, Sandboxes, Datensätze und alte API-Schlüssel bereinigen.

GitHub und Erklärungen zu Open Source

Die offizielle GitHub-Organisation von Together AI stellt Python- und TypeScript-SDKs, das Together Cookbook, Sandbox-Tools sowie zahlreiche Beispiele zur Verfügung. Die Repositorien wie das Cookbook und Sandbox verwenden jeweils eigene Open-Source-Lizenzmodelle und eignen sich zum Erlernen von API- und Agent-Workflows.

Die AI-Commercial-Cloud-Plattform, die Inferenz-Infrastruktur sowie der gesamte Servercode bilden zusammen kein vollständig open-source-Produkt. Die auf der Plattform gehosteten Modelle gehören außerdem verschiedenen Entwicklern und unterliegen unterschiedlichen Lizenzen; diese müssen vor der Nutzung einzeln überprüft werden.

Häufige Fragen

Ist Together AI kostenlos?

Die Plattform basiert hauptsächlich auf Aufladungen oder Abrechnung nach Verbrauch. Die Konten können Aktions- oder Probekredite erhalten, wobei die Beträge und Voraussetzungen variieren können. Für produktive Zwecke sollte man den tatsächlichen Verbrauch an Modellen, Medien, GPUs und Tools berücksichtigen.

Wie berechnet Together AI die Gebühren?

Textmodelle werden in der Regel nach den eingegebenen und ausgegebenen Tokens abgerechnet, Bilder, Videos und Audiodateien werden nach ihren jeweiligen Einheiten berechnet. Für spezielle Inferenzprozesse sowie GPU-Clustern wird nach der Anzahl der GPU-Stunden abgerechnet, während die Feinabstimmung der Modelle nach den für das Training verwendeten Tokens berechnet wird.

Wird das OpenAI SDK unterstützt?

Einige Chat- und Generierungs-APIs bieten eine OpenAI-kompatible Variante, um bestehende Anwendungen zu migrieren. Die Modell-ID, Parameter sowie spezielle Funktionen müssen jedoch weiterhin gemäß den Together-Dokumentationen angepasst werden.

Kann man Open-Source-Modelle feinabstimmen?

Ja, die Plattform bietet Funktionen wie SFT, LoRA, vollständige Feinabstimmung und DPO. Der Umfang der Unterstützung, die Preise sowie die Mindestgebühren variieren je nach Größe und Typ des Modells.

Ist Together AI Open Source?

Die Cloud-Plattform selbst ist kein vollständig open-source-Produkt. Das offizielle SDK, die Cookbooks sowie einige Tools sind open source, während die gehosteten Modelle den jeweiligen Modell-Lizenzen unterliegen.

©️ Urheberrechtshinweis: Sofern nicht anders angegeben, liegen die Urheberrechte an allen Artikeln auf dieser Website beiTeilen von AI-ToolsAlle Urheberrechte liegen bei uns. Ohne Genehmigung darf keine Person, kein Medienunternehmen, keine Website oder irgendeine Gruppe den Inhalt dieser Website kopieren, nachahmen oder auf andere Weise verbreiten. Ebenso ist es nicht gestattet, Spiegelseiten auf Servern zu erstellen, die nicht uns gehören. Andernfalls behalten wir uns das Recht vor, rechtliche Schritte gegen die Verantwortlichen einzuleiten.

Tools, die dem Together AI ähneln