Modelli
Ordinare la catena chat che decide il tuo predefinito, e impostare i tre modelli attività, con i vincoli che rifiuteranno il tuo primo tentativo.
Modelli nella console. Niente nel prodotto funziona finché questa pagina non ha qualcosa dentro.
Sui crediti, una parte di questa pagina è in sola lettura.
I tuoi provider e i tuoi modelli sono predisposti per te e qui non possono essere aggiunti, modificati o eliminati: quelle azioni vengono rifiutate, perché il provider fa parte del tuo piano invece di essere un account tuo. La tua organizzazione arriva anche con i modelli consigliati già assegnati a ogni lavoro, quindi niente di quello che segue è un passaggio di configurazione che devi completare.
Quello che resta tuo è chi fa cosa fra quei modelli, e le due sezioni valgono così come sono scritte: la catena chat (che è anche il modo in cui scegli il predefinito) e i modelli attività. Salta Aggiungere un provider e Aggiungere un modello. Vedi Come funziona la fatturazione.
Due livelli: i provider (un account da qualche parte, con una credenziale) e i modelli (quello che quel provider ti offre).
Se stai configurando per la prima volta, l'ordine che funziona è: aggiungi un provider, aggiungi un modello chat e mettilo in cima alla catena chat, aggiungi un modello di embedding, e poi torna per il resto.
Aggiungere un provider
Aggiungi provider, scegline uno, dagli una credenziale. Le chiavi sono crittografate a riposo.
Quasi tutti i provider vogliono un'API key. Due sono diversi:
Google Vertex accetta o un JSON di service account o le credenziali dell'ambiente stesso, più un ID progetto GCP e una regione.
Custom è qualsiasi endpoint compatibile con OpenAI: un modello ospitato in casa, un gateway, qualcosa sulla tua infrastruttura. Gli dai un URL.
Testa connessione prima di salvare. È più rapido che scoprire che la chiave è sbagliata quando lo scopre un utente.
Un provider gira sempre sulla credenziale che gli hai dato. Se manca, il provider si ferma invece di cercare qualcos'altro.
Quella salvaguardia è voluta: garantisce che il traffico sulla tua fattura sia traffico che hai autorizzato, e che un errore di configurazione si veda subito invece di girare in silenzio da qualche parte dove non volevi.
Eliminare un provider elimina anche i suoi modelli.
Aggiungere un modello
Sotto un provider, Aggiungi modello. I campi che contano:
ID modello è l'identificatore del provider stesso. Esci dal campo e prezzi, finestra di contesto e nome si compilano automaticamente da un catalogo pubblico, riempiendo solo ciò che è vuoto. Verifica prima di salvare: il catalogo è buono, non autorevole, e un prezzo sbagliato distorce in silenzio ogni cifra di costo su cui poi farai affidamento.
Finestra di contesto guida la compattazione automatica delle conversazioni. Impostala correttamente o le conversazioni lunghe si compatteranno nel punto sbagliato.
Modalità pensiero: Disattivato (non supportata), Opzionale (gli utenti hanno l'interruttore), Sempre (il modello ragiona a ogni richiesta). È questo che mette l'icona del cervello nel riquadro del messaggio.
Ricerca web integrata segnala un modello che sa cercare da solo, e si abbina all'impostazione "preferisci la ricerca nativa del modello" in Organizzazione.
Nascosto dal selettore chat tiene un modello fuori dal menu a tendina che vedono gli utenti. Usalo per tutto ciò che non è pensato per la conversazione.
I prezzi sono obbligatori. Senza, un modello gira comunque, e ogni cifra di utilizzo e di costo che tocca è sbagliata per omissione.
Modelli chat e la catena
I modelli chat non si scelgono uno alla volta. Li ordini in una catena di massimo tre, e quell'ordine decide tutto:
Il modello in cima è il predefinito della tua organizzazione. È quello con cui partono le nuove conversazioni, ed è quello che riceve una richiesta API che omette model, quindi le applicazioni che non nominano nessun modello seguono quello che sta per primo qui. Vedi Modalità gateway. Non esiste un interruttore separato "rendi questo il predefinito": promuovere un modello in cima alla catena è quell'interruttore.
Sui crediti la catena si legge esattamente come si legge dappertutto. Ogni modello porta un'etichetta di attitudine invece di un prezzo, Economico e veloce, Equilibrio tra prezzo e prestazioni oppure Massima intelligenza, così nessuna scelta dipende dal leggere un listino. I tuoi membri vedono una forma più breve della stessa etichetta nel loro selettore. Il modello con cui la tua organizzazione è stata predisposta è segnato come quello consigliato, così vedi sempre da cosa ti sei allontanato.
I modelli sotto sono la riserva. Quando il modello sopra fallisce, si prova il successivo, e all'utente viene detto quale modello ha risposto davvero invece di lasciarlo a chiedersi.
La catena copre le conversazioni nell'app. Chi chiama l'API la richiede per singola richiesta con enable_fallback, così un'applicazione che non la chiede vede il fallimento. È voluto: chi chiama può preferire un errore pulito a una risposta da un modello che non ha scelto.
Ogni modello viene testato quando salvi, quindi una catena che non può servire viene rifiutata in quel momento invece che al messaggio successivo di qualcuno.
Metti in cima un modello di fascia flash o lite.
I modelli di classe flash di oggi sono abbastanza capaci per la grande maggioranza di quello che fa questo prodotto, e la cima di questa catena viene usata in moltissimi punti: ogni conversazione dell'organizzazione, più il lavoro interno che non ha un modello proprio, come dare un nome alle conversazioni, riassumere e generare un workflow da una descrizione.
Proprio perché è usata così tanto, il suo costo e la sua latenza si sommano su ogni messaggio di ogni membro. Un modello di frontiera in questo posto significa pagare prezzi da frontiera per intitolare una conversazione, per un risultato che nessuno legge.
I membri che vogliono qualcosa di più pesante possono cambiare modello dentro una conversazione, e possono impostarsi un predefinito personale dal selettore dei modelli chat. Nessuna delle due cose cambia su cosa ripiega l'organizzazione.
Vale la pena ordinare la catena prima di averne bisogno: il disservizio di un provider diventa un peggioramento invece che un'interruzione. Metti sotto quello in cima un modello di un provider diverso, altrimenti un disservizio si porta via l'intera catena.
Sui crediti funziona diversamente, e meglio. I tuoi modelli si raggiungono attraverso un gateway che già instrada ciascuno su diversi provider a monte, quindi un singolo provider che cade viene assorbito prima ancora che la tua catena venga consultata. Quello che la tua catena aggiunge sopra è copertura per il modello stesso: metti sotto una famiglia di modelli diversa, per esempio Gemini sotto GPT, e una release sbagliata o un disservizio su tutto un modello hanno comunque dove andare.
Altre tre cose da sapere:
I tuoi utenti lo vengono a sapere. Un avviso compare sopra il riquadro del messaggio e nomina il modello non disponibile e quello che ha risposto al suo posto, e possono chiuderlo. Quindi un fallback è un peggioramento visibile invece che silenzioso, e può benissimo darsi che qualcuno te ne chieda conto prima che tu te ne sia accorto.
Guarda lo schema, non il singolo episodio. Un avviso è la catena che fa il suo lavoro. Una catena usata ripetutamente significa che il modello in cima non sta bene, e la cosa si vede nell'avviso del Pannello di controllo e nella ripartizione dei fallback in Utilizzo, entrambi da guardare una volta a settimana.
Embedding e reranking non possono avere catene, e la ragione non è una funzione mancante. Vedi sotto.
Scegliere quali modelli vede il tuo team
Ogni modello ha un interruttore: Offri questo modello agli utenti. Spento, il modello resta configurato e sparisce dal selettore di tutti.
Sui crediti è così che dai forma alla lista. La tua organizzazione viene predisposta con l'intero catalogo, e i modelli consigliati sono già accesi. Accenderne qualcuno in più, o spegnerne qualcuno, è il modo normale di decidere cosa viene offerto al tuo team senza configurare nulla.
Modelli attività
Tre slot, per i lavori in background invece che per la conversazione. Ognuno si sceglie a parte, e ognuno esiste per una ragione diversa.
Embedding
Trasforma i tuoi documenti in vettori perché una raccolta possa essere cercata per significato invece che per parola chiave. Gira quando un documento viene aggiunto e di nuovo per ogni domanda fatta a una raccolta.
Senza, le raccolte non possono essere indicizzate affatto. Gli utenti ricevono "Modello di embedding non configurato", su cui non possono fare niente. Configuralo prima che qualcuno provi a creare una raccolta.
Tre vincoli, e il primo rifiuterà il tuo primo tentativo se lo salti:
Il modello deve produrre 1024 dimensioni. È l'ampiezza canonica su cui è costruito tutto l'indice, e viene controllata quando salvi: un modello di un'altra ampiezza viene rifiutato lì e subito, invece di fallire più tardi.
Quasi tutti i provider offrono un'opzione a 1024 o un modo per richiederla. Se il modello che vuoi emette solo 1536 o 768, qui non è utilizzabile.
Dimensione batch è quanti testi entrano in una sola chiamata API, e ogni provider la limita in modo diverso (Voyage consente 1000, Cohere 96). Impostala su quello che documenta il tuo provider.
Se non conosci il limite, sii prudente: 100 o meno. Troppo alta e il provider rifiuta interi batch, cosa che si manifesta come un'indicizzazione che fallisce sui documenti grandi e funziona su quelli piccoli. Troppo bassa costa solo un po' di velocità, e l'indicizzazione è un lavoro in background.
Nessuna catena di fallback, e non potrebbe averne una. Una raccolta viene cercata con il modello che l'ha indicizzata, quindi ripiegare su un altro modello significherebbe cercare in un indice con i vettori di un altro modello: sciocchezze dette con sicurezza, invece di un errore.
Reranking
Prende i candidati trovati dal recupero e li riordina in base a quanto rispondono davvero alla domanda. Opzionale, e si guadagna il posto sulle raccolte grandi, dove il primo passaggio restituisce parecchio materiale dall'aria plausibile.
Ha la sua dimensione batch, con lo stesso consiglio: allineala al limite documentato dal provider, e resta a 100 o sotto se non lo conosci.
Nessuna catena di fallback, per lo stesso motivo dell'embedding.
Generazione immagini
Usato quando qualcuno chiede un'immagine. Opzionale: senza, quella richiesta semplicemente non è disponibile.
Deve essere un modello che genera immagini, non uno che si limita a leggerle. Un modello chat capace di visione sa descrivere un'immagine e non sa produrla. Quello che ti serve qui è un modello di immagini: i modelli di immagini di Google (quelli commercializzati come Nano Banana) o quelli di OpenAI.
Costo per immagine è opzionale e vale la pena compilarlo, perché i modelli di immagini sono tariffati per immagine invece che per token, quindi lasciarlo vuoto significa che la generazione di immagini non contribuisce niente alle tue cifre di costo.
Cosa non c'è in questa pagina
Due lavori per cui le persone si aspettano di trovare uno slot, e non ce n'è nessuno da impostare:
Scrivere documenti e presentazioni nel Workshop gira sul modello chat della conversazione che li ha chiesti. Se un membro vuole un documento scritto da un modello più forte, cambia modello nella conversazione prima di chiederlo.
Abbozzare un workflow da una descrizione gira sul tuo modello chat predefinito, e ripiega lungo la sua catena se quel modello non è disponibile.
Entrambi seguono deliberatamente il modello chat: chi chiede ha già scelto un modello per la conversazione, e rispondere in sordina su un altro farebbe litigare il costo e lo stile di scrittura con quello che aveva scelto.
Cambiare il modello di embedding
L'unico cambiamento di questa pagina con conseguenze vere, e la console si spiega bene quando ci provi.
Cambiarlo rifà l'embedding di tutto quello che è già indicizzato: frammenti di documenti, entità del grafo della conoscenza, riassunti di conversazione. Ti vengono mostrati i conteggi e una durata stimata prima di confermare.
Il meccanismo è accorto, e vale la pena fidarsene:
- I nuovi vettori vengono costruiti accanto a quelli vecchi e attivati solo quando l'intero corpus è pronto.
- La ricerca resta disponibile per tutto il tempo. L'indice attuale continua a rispondere.
- Puoi annullare in qualsiasi momento, senza perdere nulla di quanto è indicizzato.
- Se fallisce, i tuoi vettori esistenti restano intatti e tu resti sul modello precedente.
Non puoi cambiare il modello di embedding mentre un cambio è in corso.
Fallo con cognizione: su un corpus grande sono ore di lavoro, e la ragione per farlo è un modello davvero migliore, non la curiosità.
Una configurazione che funziona, dall'inizio alla fine
Per un'organizzazione che parte da zero:
| Slot | Scelta |
|---|---|
| Cima della catena chat | Un modello di fascia flash o lite. Abbastanza capace per la grande maggioranza del lavoro, usato quasi dappertutto, e predefinito per il fatto stesso di essere primo |
| Sotto di lui | La stessa fascia da un provider diverso, oppure una famiglia di modelli diversa se sei sui crediti |
| Embedding | Un modello a 1024 dimensioni, dimensione batch al limite del provider oppure 100 |
| Reranking | Opzionale. Aggiungilo quando le raccolte diventano grandi |
| Generazione immagini | Opzionale. Solo se ai tuoi membri servono immagini generate |