GLM-5.3-Flash
Z.ais Open-Weights-Modell für Multimodalität und Effizienz. Günstig und fähig genug, um einen persönlichen Assistenten den ganzen Monat laufen zu lassen.
Qualität
Modalität
Multimodal
Context
1M tokens
Zugang
Open Weights
Fabians Take
"Darauf läuft mein OpenClaw-Assistent, und für den Preis ist es unglaublich fähig und schnell. Er verwaltet meine E-Mails und meinen Kalender und macht gelegentlich eine Recherche, und das Ganze kostet mich über OpenRouter etwa CHF 5 im Monat. Es hat weniger Persönlichkeit als manche anderen Modelle, ist aber trotzdem angenehm in der Zusammenarbeit."
GLM-5.3-Flash ist Z.ais Effizienzstufe, veröffentlicht am 26. August 2026 und das erste nativ multimodale Modell der GLM-5-Serie. Es nimmt Text, Bilder, Video und Dateien entgegen und gibt Text zurück, mit Tool Calling und strukturiertem Output. Die Weights liegen auf Hugging Face unter einer MIT-Lizenz.
Das Argument dafür
Darauf läuft mein OpenClaw-Assistent. Dieser Assistent kümmert sich um meine E-Mails und meinen Kalender und macht gelegentlich eine Recherche, und das kostet mich über OpenRouter etwa CHF 5 im Monat. Für etwas, das jeden Tag arbeitet, ist das eine bemerkenswerte Zahl, und das ist das ganze Argument für dieses Modell.
Möglich macht das der Preis: 0,15 Dollar pro Million Eingabe-Tokens und 0,50 Dollar pro Million Ausgabe-Tokens, etwa ein Zehntel dessen, was das GLM-5.3-Flaggschiff kostet. Ein Assistent verbrennt viele Tokens auf Tool-Aufrufe, die nie ein Mensch liest, und bei diesen Preisen musst du dir darüber keine Gedanken mehr machen.
Eine Einstellung, die du ändern solltest
Thinking ist immer aktiv, und das Effort-Level steht standardmässig auf maximal, was sich nicht vollständig abschalten lässt. Bei schwierigen Problemen ist das genau richtig. Bei «verschieb diesen Termin» nicht, und dann bezahlst du für Reasoning, das niemand gebraucht hat. Stell reasoning_effort für Routinearbeit herunter und lass es hoch für die Aufgaben, die es verdienen.
Wo es sich einordnet
Z.ais eigene Benchmark-Tabellen sehen Flash bei mehreren agentischen, Automatisierungs- und Knowledge-Work-Bereichen vor Claude Opus 4.8 und bei einigen Coding- und Hard-Reasoning-Bereichen dahinter. Das sind Zahlen vom Hersteller selbst, darum solltest du die Richtung als informativ nehmen und die Nachkommastellen als Marketing. Die ehrliche Zusammenfassung: Es ist nah genug an den teuren Modellen bei der Art von tool-gesteuerter Arbeit, die ein Assistent macht, und weit genug darunter, dass du ihm nicht dein schwierigstes Problem geben würdest.
Es hat ausserdem spürbar weniger Persönlichkeit als die Frontier-Chatmodelle. Das spielt eine Rolle, wenn du den ganzen Tag mit ihm sprichst, und spielt überhaupt keine Rolle, wenn es still deine E-Mails ablegt.
Das Fazit
Am besten für: Für einen Assistenten oder Agenten, der den ganzen Tag über Tool-Aufrufe arbeitet, wo die Kosten pro Aufgabe wichtiger sind als Persönlichkeit.
Pro
- Günstig genug, um es einfach laufen zu lassen: ein persönlicher Assistent kostet ein paar Franken im Monat
- Nimmt Text, Bilder, Video und Dateien entgegen, was das meiste abdeckt, was ein Assistent zu sehen bekommt
- Open Weights unter MIT, nichts hindert dich also daran, es später selbst zu hosten
- Z.ais eigene Tabellen sehen es bei mehreren agentischen und Automatisierungs-Benchmarks vor Claude Opus 4.8
Contra
- Thinking ist immer aktiv und steht standardmässig auf maximalem Effort, darum kosten Routineaufgaben mehr als nötig, bis du es herunterregelst
- Weniger Persönlichkeit als die Frontier-Chatmodelle
- Die Benchmark-Siege stammen vom Hersteller selbst, und bei den schwierigeren Coding- und Reasoning-Bereichen liegt es weiterhin zurück
- Das volle 320B-Parameter-Modell selbst zu betreiben braucht ernstzunehmende Hardware
Specs
- Preis $0,15/M Eingabe, $0,50/M Ausgabe · Cache-Eingabe $0,03/M
- Kostenstufe Günstig
- ⚡Geschwindigkeit Schnell
- Lizenz MIT