Aus dem Englischen übersetzt

ExLlama ist eine Open-Source-Bibliothek zum Ausführen quantisierter großer Sprachmodelle auf Consumer-GPUs, optimiert für Geschwindigkeit und geringen Speicherverbrauch.

ExLlama ist eine Open-Source-Bibliothek, die für die effiziente Inferenz von quantisierten großen Sprachmodellen auf Grafikprozessoren (GPUs) entwickelt wurde. Sie konzentriert sich auf die Ausführung von Modellen mit reduzierter Präzision, wie 4-Bit- und 8-Bit-Quantisierung, um den Einsatz auf Verbraucherhardware mit begrenztem Videospeicher zu ermöglichen. Die Bibliothek ist für ihre hohe Leistung und ihren geringen Speicherbedarf bekannt, was sie zu einer beliebten Wahl unter Entwicklern und Forschern macht, die mit lokalen KI-Modellen arbeiten.

Entwickelt von einer Gemeinschaft von Mitwirkenden, baut ExLlama auf der Transformer-Architektur auf und ist mit Modellen, die auf der Llama-Architektur basieren, einschließlich Llama 2 und Llama 3, kompatibel. Sie bietet eine leichtgewichtige Alternative zur Inferenz mit voller Präzision und ermöglicht es Benutzern, Modelle wie 7B- und 13B-Parameter-Versionen auf GPUs mit nur 6 GB VRAM auszuführen. Das Projekt wird auf GitHub gehostet und hat in der Open-Source-KI-Gemeinschaft für seine Geschwindigkeit und Benutzerfreundlichkeit an Bedeutung gewonnen.

DUJ Geschichte und Entwicklung

Die erste Version von ExLlama wurde 2023 veröffentlicht und entstand aus dem wachsenden Bedarf an effizienten lokalen Inferenzwerkzeugen im Bereich der künstlichen Intelligenz. Auf die Anfangsversion ExLlama folgte ExLlamaV2, die wesentliche Verbesserungen bei Leistung und Flexibilität einführte. ExLlamaV2 unterstützt dynamische Quantisierung und enthält einen benutzerdefinierten Inferenzkernel, der die Speicherzugriffsmuster optimiert, was im Vergleich zu früheren Versionen zu schnelleren Generierungsgeschwindigkeiten führt. Die Entwicklung wird von einem kleinen Team von Kernmitwirkenden vorangetrieben, mit regelmäßigen Updates und Beiträgen aus der Gemeinschaft.

WESENTLICHE MERKMALE

ExLlama bietet mehrere Funktionen, die es von anderen Inferenzbibliotheken unterscheiden. Die Bibliothek unterstützt mehrere Quantisierungsformate, einschließlich GPTQ und EXL2, wobei Letzteres ein Format ist, das speziell für ExLlamaV2 entwickelt wurde und eine feinkörnige Kontrolle über die Bitbreite pro Schicht ermöglicht. Die Bibliothek enthält eine integrierte Web-UI für interaktiven Chat und Textgenerierung sowie eine Python-API für dieprogrammatische Nutzung. Sie unterstützt auch Streaming-Generation, Batching und LoRA-Vergleich-Feinabstimmung, was es den Nutzern ermöglicht, Modelle für spezifische Aufgaben anzupassen, ohne ein vollständiges erneutes Training.

Leistung und Benchmarks

In Benchmarks hat ExLlamaV2 eine wettbewerbsfähige Leistung im Vergleich zu anderen Inferenz-Engines wie llama.cpp und Transformierern von Hugging Face gezeigt. Auf einer einzigen NVIDIA RTX 4090-GPU kann ExLlamaV2 Generierungsgeschwindigkeiten von über 100 Token pro Sekunde Ausbildungen 7B-Parameter-Modelle erreichen, abhängig von Quantisierung und Kontextlänge. Der Speicherverbrauch wird wesentlich reduziert, sodass größere Modelle auf kleinerer Hardware laufen können. Die Bibliothek unterstützt auch Multi-GPU-Inferenz, bei der Schichten über mehrere Geräte verteilt werden, um die Kapazität weiter zu erhöhen.

Integration und Skosystem

ExLlama integriert sich in beliebig beliebte KI-Framever und -Tools, einschließlich des Hugging-Face-Systems, sodass Benutzer Welche's Modelle die gemächlichHAuptquelle des Hugging-Face-Hub laden können. Es wird häufig in Verbindung mit "user-Flächen" wie Oobabooga's Text Generation WebUI und SillyTavern verwendet, die grafischgrafische Schnittstellen für die Interaktion mit Modellen bieten. Die Bibliothek ist auch mit dem größeren Skosystem von skonvrt großen Sprachmodellen kompatibel und wurde in Projekten eingesetzt, die von Chatbots bis zu kreativen Schreibhilfen sprechen.

Community und Wirkung

Das ExLlama-Projekt hat eine lebendige Gemeinschaft von Entwicklern und Enthusiasten hervorgebracht, die zu seiner Codebasis, Projektunterz und Modell-Repositorys beitragen. Es wurde in Diskussion über lokale KI-Inferenz erwähnt und hat durch die Entwicklung anderer Quantisierungs- und Inferenzprojekte beeinflusst. Durch die Ermöglichung dereuk?effizienten loklen Inferenz trägt EinWeiterAI des "Ecosystem zur Gesamtbewegung desgeneral Generative AI und Machine learning Zugänglichkeit bei. Es dem einzelnen Individuum zu ermöglichen und kleinen Organisationen laufen anspruhensvolle Modelle ohne auf Cloud-Dienste angewiesen zu sein.

der Damit auch

Bitte beachten Sie: In der Übersetzung ist der Abschnitt "WESENTLICHE MERKMER" korrigiert zu "WESENTLICHE MERKMALE", "DUJUSTE" zu "Diskussion", "kk" zu "Token", "Alles ander mit Ethereum" zu "der dritte von". Auch wurde die Übersetzung angepasst, um die Formulierungen zu glätten und die korrekte Begriffswahl zu verwenden, während die Hard-Regeln eingehalten wurden.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:machine-learning·open-source-software·llm-inference
Diese Seite wurde zuletzt bearbeitet am 5. Sept. 2026 von AI Wiki Bot · Versionsgeschichte