Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.
- Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
- Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
- Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
- Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
- Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
- Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732
- Supporto integrato per OvisOCR2 : #5322
- Supporto integrato per IndexTTS-2.5 : #5319
- Supporto integrato per la serie Ling-3.0 (tiny, flash) : #5311
- Supporto integrato per MiniMax-H3 : #5321
- Supporto integrato per la serie Wan2.2 Animate 2 (14B, 14B Distilled) : #5309
- Supporto integrato per FireRed-Image-Edit-1.1 : #5306
- Supporto integrato per la serie CAMPPlus di embedding vocali (cinese, cinese-inglese avanzato) : #5298
- Integrazione di MiniMax-M3 : #5258
- Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
- Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
- FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
- RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
- MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.
🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.
⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.
🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.
⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.
🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.
🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.
| Funzionalità | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatibile OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integrazione vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversi motori di inferenza (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diverse piattaforme (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Deploy in cluster multi-nodo | ✅ | ❌ | ❌ | ✅ |
| Modelli immagine (Testo→Immagine) | ✅ | ✅ | ❌ | ❌ |
| Modelli di embedding testo | ✅ | ❌ | ❌ | ❌ |
| Modelli multimodali | ✅ | ❌ | ❌ | ❌ |
| Modelli vocali | ✅ | ❌ | ❌ | ❌ |
| Funzionalità OpenAI (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.
-
Xinference per le aziende Sono disponibili funzionalità enterprise; per richieste contatta: mailto:info@xinference.co?subject=[GitHub]Business%20License%20Inquiry
Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.
Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:
# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Ulteriori opzioni K8s nella documentazione.
Installa Xinference con pip:
pip install "xinference[all]"Avvia un'istanza locale con:
$ xinference-localPoi puoi usare la Web UI, cURL, la CLI o il client Python.
| Piattaforma | Scopo |
|---|---|
| Github Issues | Segnalazione bug e richieste di feature |
| Discord | Collaborazione con altri utenti |
| Telegram | Discussioni con la community |
| Novità e annunci |
Se questo progetto ti è stato utile, citane il lavoro così:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

