Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.
- Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
- Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
- Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
- Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
- Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
- Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732
- Supporto integrato per TeleOCR : #5583
- Supporto integrato per la serie Ming-Image (Design, Design Layer) : #5582
- Supporto integrato per Qwen-Image-2.1 : #5571
- Supporto integrato per MinerU2.5 : #5550
- Supporto integrato per la serie Spark-X2.5 (1.7B, 4B, 1.7B Base, 4B Base) : #5538
- Supporto integrato per la serie LingBot-World-V2 (14B Fast, 14B Pretrain, 1.3B Fast) : #5536
- Supporto integrato per la serie Irodori-TTS v4.1 (Anime, Small) : #5527
- Supporto integrato per YuE2-3B : #5526
- Supporto integrato per la serie AuK (AuK, AuK-Flash) : #5525
- Supporto integrato per MiniCPM5-2B : #5506
- Supporto integrato per la serie Fish Audio (S1-mini, S2-Pro) : #5490
- Supporto integrato per MonkeyOCR : #5475
- Supporto integrato per dots.ocr : #5468
- Supporto integrato per la serie JoyAI per la modifica delle immagini (Edit, Edit Plus) : #5458
- Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
- Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
- FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
- RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
- MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.
🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.
⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.
🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.
⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.
🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.
🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.
| Funzionalità | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| API RESTful compatibile OpenAI | ✅ | ✅ | ✅ | ✅ |
| Integrazione vLLM | ✅ | ✅ | ✅ | ✅ |
| Diversi motori di inferenza (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Diverse piattaforme (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Deploy in cluster multi-nodo | ✅ | ❌ | ❌ | ✅ |
| Modelli immagine (Testo→Immagine) | ✅ | ✅ | ❌ | ❌ |
| Modelli di embedding testo | ✅ | ❌ | ❌ | ❌ |
| Modelli multimodali | ✅ | ❌ | ❌ | ❌ |
| Modelli vocali | ✅ | ❌ | ❌ | ❌ |
| Funzionalità OpenAI (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.
-
Xinference per le aziende Xinference Enterprise è l’edizione commerciale per i team che eseguono modelli in produzione. È possibile distribuirla nel proprio cloud o data center, oppure scegliere una distribuzione dedicata gestita con Xinference Cloud. La Model API ospitata consente di accedere ai modelli supportati tramite un’API compatibile con OpenAI senza gestire l’infrastruttura di inferenza. Maggiori informazioni su xinference.co. Per richieste aziendali, contattateci via e-mail.
Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.
Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:
# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Ulteriori opzioni K8s nella documentazione.
Installa Xinference con pip:
pip install "xinference[all]"Avvia un'istanza locale con:
$ xinference-localPoi puoi usare la Web UI, cURL, la CLI o il client Python.
| Piattaforma | Scopo |
|---|---|
| Github Issues | Segnalazione bug e richieste di feature |
| Discord | Collaborazione con altri utenti |
| Telegram | Discussioni con la community |
| Novità e annunci |
Se questo progetto ti è stato utile, citane il lavoro così:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

