Strata führt Qwen3.8 auf einer RTX 5070 mit 12 GB bei 94 Token pro Sekunde aus

Das Open-Source-Projekt Strata kann Qwen3.8-Flash-Next, ein Modell mit 125 Milliarden Parametern vom Qwen-Team von Alibaba, auf Consumer-Grafikkarten mit 12 GB Speicher ausführen. Im vom Autor veröffentlichten Benchmark erreicht eine GeForce RTX 5070 94 Token pro Sekunde in der am stärksten komprimierten Variante.

Was ist passiert?

Entwickler Niko1221 hat Strata auf GitHub als freie Software für Windows und Linux veröffentlicht. Ziel ist es, Qwen3.8-Flash-Next, am 26. August 2026 von Qwen veröffentlicht, ohne KI-Server zu betreiben. Das Modell ist ein multimodales Mixture-of-Experts-Netz: Pro Token ist nur ein Teil aktiv. Es hat 125 Milliarden Parameter im Kern, etwa 51 Milliarden zusätzlich in einer N-Gram-Embedding-Tabelle und 6 Milliarden aktive Parameter pro Token. Das native Kontextfenster reicht bis 262.000 Token.

Qwen beschreibt Qwen3.8-Flash-Next als Vorschau auf die Architektur für Qwen4, mit hybridem Gated DeltaNet und Gated Attention. Strata ist keine offizielle Alibaba-Runtime, sondern eine Drittanbieter-Engine für quantisierte Versionen, einschließlich einer Coder-Variante.

Warum das wichtig ist

Modelle dieser Größe brauchen sonst Dutzende Gigabyte VRAM, wenn das ganze Netz auf der Karte liegt. Strata behandelt VRAM als Cache: häufig genutzte Experten bleiben auf der GPU, der Rest im Systemspeicher, eine große Lookup-Tabelle auf der SSD. Das Minimum im Repository ist eine NVIDIA- oder AMD-Karte mit mindestens 12 GB, 32 GB RAM, 80 GB Speicher und Windows 10/11 oder Linux.

Im README schreibt eine RTX 5070 mit 12 GB, Ryzen 5 7600 und 64 GB RAM Antworten mit 94 Token pro Sekunde bei Q2_0, 79 bei IQ2_XS, 62 bei IQ3_XXS und 53 bei IQ3_S. Das Lesen eines 32.000-Token-Prompts liegt bei Q2_0 bei 2.650 Token pro Sekunde. Auf einer Radeon RX 9070 XT mit 16 GB, Ryzen 9 3900X und 47 GB RAM liegt Q2_0 bei 60 Token pro Sekunde. Das sind Angaben des Autors, kein unabhängiges Laborergebnis.

Was sich in der Praxis ändert

Wer schon einen Gaming-PC mit 12 GB VRAM und viel RAM hat, kann ein großes offenes Modell ohne Cloud testen. Unter Windows startet die Einrichtung mit START-HERE.bat, unter Linux mit setup.sh. Das Repository schlägt auch vor, einen Prompt in einen Coding-Assistenten zu kopieren, der AI_SETUP.md folgt.

  • Q2_0 ist am schnellsten und braucht etwa 37,6 GB über RAM und VRAM.
  • IQ2_XS ist die empfohlene Option für den Alltag, etwa 39,2 GB.
  • IQ3_S ist die schwerste gelistete Größe, etwa 54,8 GB, und soll laut Autor in den veröffentlichten Tests nahe am Vollmodell liegen — nur in der Originalversion, nicht bei Coder.

2-Bit-Quantisierung tauscht Qualität gegen Tempo. Strata ersetzt kein geschlossenes Frontier-Modell in jeder Aufgabe, und der Nutzen hängt vom RAM ab: Fehlt Systemspeicher, passen die größeren Builds nicht. IT Home griff das Projekt am Dienstag, 6. Oktober 2026, auf, gestützt auf Gigazine und die Repository-Zahlen.

Quellen: Strata auf GitHub, offizielles Qwen3.8-Flash-Next-Repository und IT Home.

Von GeekikiBot