Asteria Docs

Modelle

Die Chat-Kette ordnen, die Ihren Standard bestimmt, und die drei Aufgabenmodelle setzen, samt der Bedingungen, an denen Ihr erster Versuch scheitert.

Modelle in der Konsole. Nichts im Produkt funktioniert, bevor auf dieser Seite etwas steht.

Mit Guthaben ist ein Teil dieser Seite schreibgeschützt.

Ihre Anbieter und Modelle werden für Sie bereitgestellt und lassen sich hier nicht hinzufügen, bearbeiten oder löschen: Diese Aktionen werden abgelehnt, weil der Anbieter Teil Ihres Plans ist und kein eigenes Konto von Ihnen. Ihre Organisation kommt außerdem mit den empfohlenen Modellen an, die jeder Aufgabe bereits zugewiesen sind, nichts hier unten ist also ein Einrichtungsschritt, den Sie noch erledigen müssten.

Ihnen bleibt, welches dieser Modelle was tut, und beide Abschnitte gelten wie geschrieben: die Chat-Kette (über die Sie auch den Standard wählen) und die Aufgabenmodelle. Überspringen Sie Einen Anbieter hinzufügen und Ein Modell hinzufügen. Siehe Wie die Abrechnung funktioniert.

Zwei Ebenen: Anbieter (ein Konto irgendwo, mit Zugangsdaten) und Modelle (was dieser Anbieter Ihnen anbietet).

Wenn Sie zum ersten Mal einrichten, ist das die Reihenfolge, die funktioniert: einen Anbieter hinzufügen, ein Chat-Modell hinzufügen und an die Spitze der Chat-Kette setzen, ein Einbettungsmodell hinzufügen, und dann für den Rest zurückkommen.

Einen Anbieter hinzufügen

Anbieter hinzufügen, einen auswählen, Zugangsdaten hinterlegen. Schlüssel werden im Ruhezustand verschlüsselt.

Die meisten Anbieter wollen einen API-Schlüssel. Zwei sind anders:

Google Vertex nimmt entweder ein Dienstkonto-JSON oder die Zugangsdaten der Umgebung selbst, dazu eine GCP-Projekt-ID und eine Region.

Custom ist jeder OpenAI-kompatible Endpunkt: ein selbst gehostetes Modell, ein Gateway, etwas auf Ihrer eigenen Infrastruktur. Sie geben ihm eine URL.

Verbindung testen, bevor Sie speichern. Das geht schneller, als zu entdecken, dass der Schlüssel falsch ist, wenn es ein Benutzer tut.

Ein Anbieter läuft immer mit den Zugangsdaten, die Sie ihm gegeben haben. Fehlen sie, hält der Anbieter an, statt nach etwas anderem zu greifen.

Diese Absicherung ist Absicht: Sie garantiert, dass der Verkehr auf Ihrer Rechnung Verkehr ist, den Sie autorisiert haben, und dass ein Konfigurationsfehler sofort auffällt, statt still irgendwo zu laufen, wo Sie ihn nie wollten.

Einen Anbieter zu löschen löscht auch seine Modelle.

Ein Modell hinzufügen

Unter einem Anbieter: Modell hinzufügen. Die Felder, auf die es ankommt:

Modell-ID ist die Kennung des Anbieters selbst. Verlassen Sie das Feld, und Preise, Kontextfenster und Name füllen sich automatisch aus einem öffentlichen Katalog, und zwar nur dort, wo noch nichts steht. Prüfen Sie das vor dem Speichern: Der Katalog ist gut, aber nicht maßgeblich, und ein falscher Preis verzerrt still jede Kostenzahl, auf die Sie sich später verlassen.

Kontextfenster steuert die automatische Kompaktierung von Unterhaltungen. Setzen Sie es richtig, sonst werden lange Unterhaltungen am falschen Punkt kompaktiert.

Denkmodus: Aus (nicht unterstützt), Optional (Benutzer bekommen den Schalter), Immer (das Modell denkt bei jeder Anfrage nach). Das ist es, was das Gehirn-Symbol ins Eingabefeld bringt.

Integrierte Websuche kennzeichnet ein Modell, das selbst suchen kann, und passt zur Einstellung "Eigene Suche des Modells bevorzugen" unter Organisation.

Vom Chat-Selektor ausgeblendet hält ein Modell aus der Auswahl für Benutzer heraus. Nutzen Sie das für alles, was nicht für Unterhaltungen gedacht ist.

Preise sind Pflicht. Ohne sie läuft ein Modell zwar, aber jede Nutzungs- und Kostenzahl, die es berührt, ist um diesen Betrag falsch.

Chat-Modelle und die Kette

Chat-Modelle werden nicht einzeln gewählt. Sie ordnen sie zu einer Kette von bis zu drei Modellen, und diese Reihenfolge entscheidet alles:

Das Modell an der Spitze ist der Standard Ihrer Organisation. Damit starten neue Unterhaltungen, und das bekommt eine API-Anfrage, die model weglässt. Anwendungen, die kein Modell nennen, folgen also dem, was hier zuoberst steht. Siehe Gateway-Modus. Es gibt keinen eigenen Schalter "als Standard festlegen": Ein Modell an die Spitze der Kette zu setzen ist dieser Schalter.

Mit Guthaben liest sich die Kette genauso wie überall sonst. Jedes Modell trägt eine Kennzeichnung statt eines Preises, Günstig und schnell, Ausgewogenes Preis-Leistungs-Verhältnis oder Beste Intelligenz, sodass keine Wahl von einer Preisliste abhängt. Ihre Mitglieder sehen in ihrer eigenen Modellauswahl eine kürzere Form derselben Kennzeichnung. Das Modell, mit dem Ihre Organisation bereitgestellt wurde, ist als das empfohlene markiert, sodass Sie immer sehen, wovon Sie sich entfernt haben.

Die Modelle darunter sind die Rückfallebene. Fällt das Modell darüber aus, wird das nächste versucht, und dem Benutzer wird gesagt, welches Modell tatsächlich geantwortet hat, statt ihn rätseln zu lassen.

Die Kette gilt für Unterhaltungen in der App. API-Aufrufer entscheiden sich pro Anfrage mit enable_fallback dafür, sodass eine Anwendung, die nicht danach fragt, den Fehler sieht. Das ist Absicht: Ein Aufrufer bevorzugt womöglich einen sauberen Fehler gegenüber einer Antwort von einem Modell, das er nicht gewählt hat.

Jedes Modell wird beim Speichern getestet, sodass eine Kette, die nicht liefern kann, an dieser Stelle abgelehnt wird und nicht erst bei der nächsten Nachricht von jemandem.

Setzen Sie ein Modell der Flash- oder Lite-Stufe an die Spitze.

Die heutigen Flash-Modelle sind für die große Mehrheit dessen, was dieses Produkt tut, ausreichend leistungsfähig, und die Spitze dieser Kette wird an sehr vielen Stellen genutzt: für jede Unterhaltung in der Organisation und dazu für interne Arbeit, die kein eigenes Modell hat, etwa Unterhaltungen zu benennen, zusammenzufassen und einen Workflow aus einer Beschreibung zu erzeugen.

Weil sie so breit genutzt wird, summieren sich ihre Kosten und ihre Latenz über jede Nachricht jedes Mitglieds. Ein Spitzenmodell an dieser Stelle heißt, Spitzenpreise dafür zu zahlen, dass eine Unterhaltung einen Titel bekommt, den niemand liest.

Mitglieder, die etwas Schwereres möchten, können in einer Unterhaltung das Modell wechseln und sich in der Chat-Modellauswahl einen eigenen persönlichen Standard setzen. Beides ändert nichts daran, worauf die Organisation zurückfällt.

Es lohnt sich, die Kette zu ordnen, bevor Sie sie brauchen: Aus einem Anbieterausfall wird dann eine Verschlechterung statt eines Ausfalls. Setzen Sie ein Modell eines anderen Anbieters unter das oberste, sonst reißt ein Ausfall die ganze Kette mit.

Mit Guthaben funktioniert das anders und besser. Ihre Modelle werden über ein Gateway erreicht, das jedes einzelne bereits über mehrere eigene Anbieter im Hintergrund verteilt, sodass ein einzelner Anbieterausfall abgefangen wird, bevor Ihre Kette überhaupt befragt wird. Was Ihre Kette obendrauf legt, ist Absicherung für das Modell selbst: Setzen Sie eine andere Modellfamilie darunter, etwa Gemini unter GPT, und ein missratenes Release oder ein modellweiter Ausfall hat immer noch ein Ziel.

Drei Dinge noch:

Ihre Benutzer erfahren es. Über dem Eingabefeld erscheint ein Hinweis, der das nicht verfügbare Modell und das antwortende Modell nennt und den sie ausblenden können. Ein Rückfall ist also eine sichtbare Verschlechterung statt einer stillen, und gut möglich, dass jemand Sie darauf anspricht, bevor Sie es bemerkt haben.

Achten Sie auf das Muster, nicht auf den Einzelfall. Ein Hinweis ist die Kette bei der Arbeit. Wird die Kette wiederholt genutzt, ist das Modell an der Spitze nicht gesund, und das zeigt sich in der Warnung im Dashboard und in der Aufschlüsselung der Rückfälle unter Nutzung. Beides ist einen wöchentlichen Blick wert.

Einbettung und Reranking können keine Ketten haben, und der Grund ist keine fehlende Funktion. Siehe unten.

Auswählen, welche Modelle Ihr Team sieht

Jedes Modell hat einen Schalter: Dieses Modell den Nutzern anbieten. Ausgeschaltet bleibt das Modell konfiguriert und verschwindet aus der Auswahl aller.

Mit Guthaben gestalten Sie so die Liste. Ihre Organisation wird mit dem gesamten Katalog bereitgestellt, und die empfohlenen Modelle sind bereits eingeschaltet. Einige weitere einzuschalten oder einige auszuschalten ist der normale Weg, um zu entscheiden, was Ihrem Team angeboten wird, ohne etwas zu konfigurieren.

Aufgabenmodelle

Drei Plätze, für Hintergrundarbeiten statt für Unterhaltungen. Jeder wird getrennt gewählt, und jeder hat einen anderen Daseinsgrund.

Einbettungen

Verwandelt Ihre Dokumente in Vektoren, damit eine Sammlung nach Bedeutung durchsucht werden kann statt nach Stichwort. Läuft, wenn ein Dokument hinzugefügt wird, und noch einmal bei jeder Frage an eine Sammlung.

Ohne eines lassen sich Sammlungen überhaupt nicht indexieren. Benutzer bekommen "Kein Einbettungsmodell konfiguriert", und damit können sie nichts anfangen. Konfigurieren Sie das, bevor jemand eine Sammlung anlegen will.

Drei Bedingungen, und die erste lehnt Ihren ersten Versuch ab, wenn Sie sie überspringen:

Das Modell muss 1024 Dimensionen ausgeben. Das ist die Breite, auf der der gesamte Index aufgebaut ist, und sie wird beim Speichern geprüft: Ein Modell anderer Breite wird sofort abgelehnt, statt später zu scheitern.

Die meisten Anbieter bieten eine Variante mit 1024 an oder einen Weg, eine anzufordern. Wenn das Modell, das Sie möchten, nur 1536 oder 768 liefert, ist es hier nicht verwendbar.

Stapelgröße ist die Anzahl der Texte, die in einen API-Aufruf gehen, und jeder Anbieter begrenzt sie anders (Voyage erlaubt 1000, Cohere 96). Setzen Sie sie auf das, was Ihr Anbieter dokumentiert.

Wenn Sie die Grenze nicht kennen, bleiben Sie vorsichtig: 100 oder weniger. Zu hoch, und der Anbieter lehnt ganze Stapel ab, was sich als Indexierung zeigt, die bei großen Dokumenten scheitert und bei kleinen klappt. Zu niedrig kostet nur ein wenig Durchsatz, und Indexierung ist eine Hintergrundarbeit.

Keine Ersatzkette, und sie könnte auch keine haben. Eine Sammlung wird mit dem Modell durchsucht, das sie indexiert hat. Auf ein anderes Modell zurückzufallen hieße, einen Index mit den Vektoren eines anderen Modells zu durchsuchen: selbstbewusster Unsinn statt eines Fehlers.

Reranking

Nimmt die Kandidaten, die die Suche gefunden hat, und sortiert sie danach, wie gut sie die Frage tatsächlich beantworten. Optional, und lohnt sich bei großen Sammlungen, wo der erste Durchgang reichlich plausibel wirkendes Material zurückgibt.

Hat eine eigene Stapelgröße, mit demselben Rat: die dokumentierte Grenze des Anbieters treffen, und bei 100 oder darunter bleiben, wenn Sie sie nicht kennen.

Keine Ersatzkette, aus demselben Grund wie bei den Einbettungen.

Bildgenerierung

Wird genutzt, wenn jemand nach einem Bild fragt. Optional: ohne sie steht diese Anfrage schlicht nicht zur Verfügung.

Es muss ein Modell sein, das Bilder erzeugt, nicht eines, das sie nur lesen kann. Ein visionsfähiges Chat-Modell kann ein Bild beschreiben und keines herstellen. Was Sie hier brauchen, ist ein Bildmodell: die Bildmodelle von Google Gemini (die als Nano Banana vermarkteten) oder die Bildmodelle von OpenAI.

Kosten pro Bild sind optional und lohnen sich auszufüllen, denn Bildmodelle werden pro Bild abgerechnet statt pro Token. Bleibt das Feld leer, trägt die Bildgenerierung nichts zu Ihren Kostenzahlen bei.

Was nicht auf dieser Seite steht

Zwei Aufgaben, für die man hier einen Platz erwartet, und es gibt keinen einzustellen:

Dokumente und Präsentationen in der Werkstatt zu erstellen läuft auf dem Chat-Modell der Unterhaltung, die darum gebeten hat. Möchte ein Mitglied ein Dokument von einem stärkeren Modell schreiben lassen, wechselt es vor der Frage das Modell in der Unterhaltung.

Einen Workflow aus einer Beschreibung zu entwerfen läuft auf Ihrem Standard-Chat-Modell und fällt durch dessen Kette, wenn dieses Modell nicht verfügbar ist.

Beides folgt bewusst dem Chat-Modell: Wer fragt, hat für die Unterhaltung bereits ein Modell gewählt, und still auf einem anderen zu antworten würde dazu führen, dass Kosten und Schreibstil nicht zu dieser Wahl passen.

Das Einbettungsmodell wechseln

Die eine Änderung auf dieser Seite mit echten Folgen, und die Konsole erklärt sich gut, wenn Sie es versuchen.

Ein Wechsel bettet alles bereits Indexierte neu ein: Dokumentabschnitte, Entitäten des Wissensgraphen, Zusammenfassungen von Unterhaltungen. Sie sehen die Mengen und eine geschätzte Dauer, bevor Sie sich festlegen.

Der Ablauf ist sorgfältig gebaut und verdient Vertrauen:

  • Neue Vektoren werden neben den alten aufgebaut und erst eingewechselt, wenn der gesamte Bestand fertig ist.
  • Die Suche bleibt durchgehend verfügbar. Der aktuelle Index antwortet weiter.
  • Sie können jederzeit abbrechen, und nichts Indexiertes geht verloren.
  • Scheitert es, bleiben Ihre bestehenden Vektoren unberührt, und Sie bleiben auf dem bisherigen Modell.

Während ein Wechsel läuft, können Sie das Einbettungsmodell nicht ändern.

Tun Sie das mit Bedacht: Bei einem großen Bestand sind das Stunden Arbeit, und der Grund dafür ist ein wirklich besseres Modell, nicht Neugier.

Ein funktionierendes Setup, von Anfang bis Ende

Für eine Organisation, die bei null anfängt:

PlatzWahl
Spitze der Chat-KetteEin Modell der Flash- oder Lite-Stufe. Leistungsfähig genug für die große Mehrheit der Arbeit, fast überall im Einsatz, und Ihr Standard, weil es an erster Stelle steht
DarunterDieselbe Stufe von einem anderen Anbieter, oder eine andere Modellfamilie, wenn Sie mit Guthaben arbeiten
EinbettungenEin Modell mit 1024 Dimensionen, Stapelgröße an der Grenze des Anbieters oder bei 100
RerankingOptional. Nehmen Sie es dazu, wenn Sammlungen groß werden
BildgenerierungOptional. Nur wenn Ihre Mitglieder generierte Bilder brauchen

On this page