Was sind Uncensored LLMs?

Uncensored LLMs sind Open-Weight-Sprachmodelle, die dahingehend modifiziert wurden, um bestimmte Ablehnungsverhalten (Refusals) abzumildern, wie sie bei Standard-KI-Assistenten üblich sind. Sie geben dem Nutzer mehr Kontrolle über das Modellverhalten und sind daher besonders relevant für Personen, die LLMs lokal ausführen und experimentieren.

Was sind Uncensored LLMs?

Die meisten modernen KI-Assistenten sind so trainiert, dass sie Sicherheitsregeln einhalten und bestimmte Anfragen ablehnen. Dieses Verhalten kann aus Instruktionstuning (Instruction Tuning), Präferenztraining, System-Prompts und anderen Bestandteilen des Modells oder der Anwendung resultieren.

Ein uncensored LLM ist in der Regel ein Modell, das so modifiziert oder trainiert wurde, dass einige dieser Ablehnungsverhalten reduziert werden. Es gibt keine einheitliche technische Definition des Begriffs „uncensored“ (unzensiert). Verschiedene Modellentwickler setzen unterschiedliche Methoden ein, weshalb die resultierenden Modelle sich in ihrem Verhalten erheblich unterscheiden können.

Manche uncensored Modelle entstehen durch zusätzliches Fine-Tuning (Feinabstimmung). Andere nutzen Techniken, die bestimmte Verhaltensweisen in einem vorhandenen Modell ändern. Der Begriff kann sich auch auf Modelle beziehen, die als abliterated (abliteriert) beschrieben werden, wobei Abliteration eine spezifische Technik ist und kein Synonym für jedes uncensored Modell.

Uncensored bedeutet nicht unbegrenzt

Die Entfernung oder Reduzierung von Ablehnungsverhalten macht ein Modell nicht fähiger. Ein uncensored Modell kann weiterhin fehlerhafte Informationen liefern, Instruktionen missverstehen oder bestimmte Anfragen ablehnen.

  • Fähigkeiten sind weiterhin entscheidend: Ein kleineres Modell wird nicht zu einem besseren Logiker, nur weil sein Ablehnungsverhalten geändert wurde.
  • Qualität variiert: Uncensored Modelle können sich je nach zugrunde liegendem Modell und der Art der Modifikation erheblich unterscheiden.
  • Verhalten ist nicht garantiert: Ein uncensored Modell kann weiterhin einige Anfragen ablehnen oder Instruktionen inkonsistent befolgen.
  • Sicherheitsverhalten kann sich ändern: Die Reduzierung von Ablehnungen kann auch einige Sicherheitsmechanismen entfernen, die Teil des Trainings des ursprünglichen Modells waren.

Es ist daher nützlicher, „uncensored“ als eine Beschreibung des Modellverhaltens zu betrachten,而非 als eine Garantie dafür, was das Modell tun kann.

Uncensored vs. Open-Weight vs. Basismodelle

Diese Begriffe werden oft zusammen verwendet, beschreiben aber unterschiedliche Aspekte eines LLMs.

Begriff Bedeutung
Open-Weight Die Modellgewichte (Weights) sind zum Herunterladen und Ausführen verfügbar.
Basismodell (Base model) Das zugrunde liegende Modell vor zusätzlicher Instruktion oder Verhaltensanpassung.
Fine-Tuning Ein Modell, das auf einem bestimmten Datensatz oder für ein spezifisches Ziel weiter trainiert wurde.
Uncensored Modell Ein Modell, das so modifiziert oder trainiert wurde, dass einige Ablehnungsverhalten reduziert werden.
Abliteriertes Modell Ein Modell, das mittels einer Abliteration-Technik modifiziert wurde, um spezifische Ablehnungsverhalten zu reduzieren.

Diese Kategorien können sich überschneiden. Ein uncensored Modell kann Open-Weight sein und auf einem vorhandenen Modell basieren. Es kann auch ein Fine-Tune oder eine andere Modifikation dieses Modells sein. Das Etikett allein erklärt nicht genau, wie das Modell erstellt wurde.

Warum ein uncensored LLM lokal ausführen?

Die lokale Ausführung eines uncensored LLMs gibt dem Nutzer mehr Kontrolle über das Modell und dessen Umgebung. Anstatt sich auf einen gehosteten KI-Dienst zu verlassen, läuft das Modell auf Hardware, die vom Nutzer kontrolliert wird.

  • Kontrolle: Sie wählen das Modell, die Inferenzsoftware und die Konfiguration.
  • Datenschutz: Prompts und generierte Antworten können innerhalb Ihrer eigenen Compute-Umgebung bleiben.
  • Anpassung: Open-Weight-Modelle können für verschiedene Workloads modifiziert, feinjustiert und konfiguriert werden.
  • Offline-Nutzung: Ein lokal gehostetes Modell muss keine Prompts an einen externen KI-Dienst senden.
  • Experimentierung: Entwickler und Forscher können verschiedene Modellversionen und -modifikationen vergleichen.

Die lokale Inferenz gibt Ihnen auch die Kontrolle über die Hardware, auf der das Modell läuft. Dies wird mit steigenden Modellgrößen immer wichtiger.

Welche Hardware benötigen uncensored LLMs?

Uncensored Modelle haben in der Regel dieselben Hardwareanforderungen wie das zugrunde liegende Modell, auf dem sie basieren. Die Hauptfaktoren sind Modellgröße, Quantisierung, Kontextlänge und Inferenzeinstellungen.

Ein größeres Modell benötigt mehr Speicher als ein kleineres. Quantisierung kann den Speicherbedarf zum Laden des Modells reduzieren und macht größere Modelle auf GPUs mit weniger VRAM praktikabel.

VRAM wird auch vom Inferenzprozess selbst genutzt. Der KV-Cache und andere Laufzeitdaten erfordern zusätzlichen Speicher, und längere Kontextfenster können den Speicheraufwand erhöhen.

Das bedeutet, dass die Auswahl eines Modells nur ein Teil der Planung eines lokalen LLM-Setups ist. Die GPU muss genügend verfügbare VRAM für das Modell und die geplante Arbeitslast besitzen.

Probieren Sie es auf DaDesktop aus

Wenn Sie ein uncensored LLM ausführen möchten, ohne eigene GPU-Hardware zu kaufen und zu installieren, bietet DaDesktop Cloud-Desktops mit dedizierten GPU-Ressourcen an. Sie können lokale LLM-Workloads auf DaDesktop ausführen oder verfügbare GPU-Optionen vergleichen basierend auf dem Modell, das Sie ausführen möchten.

Starten Sie noch heute Ihre kostenlose Testversion

Führen Sie reibungslose virtuelle IT-Schulungen mit cloud-basierten Laboren durch, ohne Ausfallzeiten – nur skalierbares Lernen, das funktioniert.