Skip to content

Latest commit

 

History

History
200 lines (153 loc) · 14.3 KB

File metadata and controls

200 lines (153 loc) · 14.3 KB
xorbits

Xorbits Inference: rendere semplice il deploy dei modelli 🤖

Xinference Enterprise · Self-Hosting · Documentazione

PyPI Latest Release License Build Status Docker Pulls Discord Telegram Twitter

English 日本語 한국어 Deutsch Français
Español Italiano Português 繁體中文 简体中文


Xorbits Inference (Xinference) è una libreria potente e versatile per modelli di linguaggio, riconoscimento vocale e modelli multimodali. Con Xinference puoi distribuire il tuo modello o modelli integrati di ultima generazione con un solo comando e servirli come servizio. Ricercatori, sviluppatori e data scientist possono sfruttare appieno le capacità dei moderni modelli di IA.

🔥 Novità in evidenza

Miglioramenti del framework

  • Xinference 3.0.0 è disponibile con note di migrazione e modifiche incompatibili: Note di rilascio
  • Deploy nativo per agenti: Xinference si integra con Xagent fornendo pianificazione dinamica, utilizzo di tool e inferenze multi-step autonome, superando i limiti delle pipeline statiche.
  • Batching automatico: più richieste concorrenti vengono raggruppate automaticamente per aumentare significativamente il throughput. : #4197
  • Xllamacpp: nuove binding Python per llama.cpp, mantenute dal team Xinference, che supportano il batching continuo e sono più adatte alla produzione. : #2997
  • Inferenza distribuita: i modelli possono essere eseguiti attraverso più worker: #2877
  • Miglioramenti per vLLM: condivisione del KV-cache tra più repliche: #2732

Nuovi modelli

Integrazioni

  • Xagent: piattaforma enterprise per agenti con pianificazione, memoria e integrazione di tool.
  • Dify: piattaforma LLMOps per costruire rapidamente applicazioni con visualizzazione e controllo.
  • FastGPT: piattaforma di conoscenza basata su LLM per l'elaborazione dei dati e le chiamate ai modelli.
  • RAGFlow: motore RAG open-source per una comprensione profonda dei documenti.
  • MaxKB: assistente open-source per basi di conoscenza con integrazione RAG.

Funzionalità principali

🌟 Deploy di modelli semplificato: semplifica l'esposizione di LLM, modelli di riconoscimento vocale e modelli multimodali. I modelli di sperimentazione e produzione possono essere configurati e distribuiti con un unico comando.

⚡️ Modelli all'avanguardia facilmente accessibili: prova i modelli integrati con un solo comando. Xinference offre accesso a modelli open source di ultima generazione.

🖥 Supporto per hardware eterogeneo: sfrutta GPU e CPU in modo efficiente (es. tramite ggml) per accelerare l'inferenza.

⚙️ API e interfacce flessibili: API RESTful compatibile OpenAI (incluso Function Calling), RPC, CLI, Web UI, ecc.

🌐 Deploy distribuito: facilita la distribuzione dell'inferenza su più dispositivi e macchine.

🔌 Integrazioni di terze parti: integrazione con LangChain, [LlamaIndex], [Dify], [Chatbox], ecc.

Perché Xinference

Funzionalità Xinference FastChat OpenLLM RayLLM
API RESTful compatibile OpenAI ✅ ✅ ✅ ✅
Integrazione vLLM ✅ ✅ ✅ ✅
Diversi motori di inferenza (GGML, TensorRT) ✅ ❌ ✅ ✅
Diverse piattaforme (CPU, Metal) ✅ ✅ ❌ ❌
Deploy in cluster multi-nodo ✅ ❌ ❌ ✅
Modelli immagine (Testo→Immagine) ✅ ✅ ❌ ❌
Modelli di embedding testo ✅ ❌ ❌ ❌
Modelli multimodali ✅ ❌ ❌ ❌
Modelli vocali ✅ ❌ ❌ ❌
Funzionalità OpenAI (Function Calling) ✅ ❌ ❌ ❌

Come usare Xinference

  • Self-Hosting Xinference Community Edition Segui la guida di avvio per lanciare Xinference localmente. Dettagli nella documentazione: https://inference.readthedocs.io/.

  • Xinference per le aziende Xinference Enterprise è l’edizione commerciale per i team che eseguono modelli in produzione. È possibile distribuirla nel proprio cloud o data center, oppure scegliere una distribuzione dedicata gestita con Xinference Cloud. La Model API ospitata consente di accedere ai modelli supportati tramite un’API compatibile con OpenAI senza gestire l’infrastruttura di inferenza. Maggiori informazioni su xinference.co. Per richieste aziendali, contattateci via e-mail.

Rimani aggiornato

Dai una stella a Xinference su GitHub per ricevere aggiornamenti sulle release.

star-us

Getting started

Docker

Gli utenti con GPU NVIDIA possono usare l'immagine Docker di Xinference. Verifica che Docker e CUDA siano installati prima dell'uso.

docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0

K8s (Helm)

Dopo aver abilitato le GPU nel cluster Kubernetes, installa con:

# Aggiungi repository
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts

# Aggiorna indice e controlla le versioni
helm repo update xinference
helm search repo xinference/xinference --devel --versions

# Installa Xinference
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>

Ulteriori opzioni K8s nella documentazione.

Quickstart

Installa Xinference con pip:

pip install "xinference[all]"

Avvia un'istanza locale con:

$ xinference-local

Poi puoi usare la Web UI, cURL, la CLI o il client Python.

web UI

Contribuire

Piattaforma Scopo
Github Issues Segnalazione bug e richieste di feature
Discord Collaborazione con altri utenti
Telegram Discussioni con la community
Twitter Novità e annunci

Citazione

Se questo progetto ti è stato utile, citane il lavoro così:

@inproceedings{lu2024xinference,
    title = "Xinference: Making Large Model Serving Easy",
    author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
    booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
    month = nov,
    year = "2024",
    address = "Miami, Florida, USA",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.emnlp-demo.30",
    pages = "291--300",
}

Collaboratori

Storico stelle

Star History Chart