Laguna S 2.1
Laguna S 2.1 Modell-Übersicht
Laguna S 2.1 ist das neue Open-Weight-Modell von Poolside, das auf Agentic Coding und Aufgaben in Agentic Workflows über lange Zeithorizonte ausgelegt ist. Technisch ist es ein Mixture-of-Experts-Modell mit 118 Mrd. Parametern, von denen pro Token nur rund 8 Mrd. aktiv sind. Das hält die Inference günstig und erlaubt Self-Hosting auf einer einzelnen NVIDIA DGX Spark! Mit einem Kontextfenster von gut 1 Mio. Token und einem Preis von $0,10 / $0,20 pro 1 Mio. Input-/Output-Token liegt es preislich deutlich unter proprietären Flaggschiffen wie Claude Sonnet 5 oder GPT-5.6 Terra. In Coding-Benchmarks wie Terminal-Bench 2.1 (70,2 %) und SWE-Bench Pro (59,4 %) hält Poolside laut eigenen Angaben mit teils mehrfach größeren Modellen mit. Anders als reine Cloud-Modelle sind die Gewichte unter der OpenMDW-1.1-Lizenz frei verfügbar, sodass Teams sensiblen Code im eigenen Rechenzentrum halten können.
Features
Tools
Websuche, Bildgenerierung, Computer Use und MCP-Server.
Multimodalität
Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.
Finetuning
Finetuning des Modells ist aktuell nicht möglich.
Details zum Modell
Laguna S 2.1 Benchmark Scores
Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.
Technologie & Daten
Laguna S 2.1 ist ein Sparse-Mixture-of-Experts-Modell mit 118 Mrd. Gesamtparametern und rund 8 Mrd. pro Token aktivierten Parametern (256 geroutete Experten, Top-10, plus 1 gemeinsamer Experte). Die 48 Layer kombinieren 12 Global-Attention- mit 36 Sliding-Window-Attention-Schichten (Fenster 512) und nutzen Grouped-Query-Attention mit 8 KV-Heads (Head-Dim 128). Das Modell wurde laut Poolside in unter vier Wochen auf 4.000 H200-GPUs mit rund 30 Billionen Tokens trainiert. Es unterstützt Interleaved Thinking zwischen Tool-Calls mit Kontrolle pro Request sowie einen Thinking- und einen No-Thinking-Modus. Für den Betrieb stehen Quantisierungen (FP8, NVFP4, INT4, GGUF) und ein DFlash-Draft-Modell für Speculative Decoding bereit.
Technische Spezifikationen
| Architektur | Mixture-of-Experts Transformer |
|---|---|
| Input Kontextlänge | 1,05 Mio. |
| Output Kontextlänge | 131,07k |
| Tokenizer | Laguna-Family-Tokenizer |
Besonderheiten
| Self-Hosting auf einem DGX Spark | Kompakt genug, um quantisiert auf einem einzelnen NVIDIA DGX Spark zu laufen. |
|---|---|
| Interleaved Thinking | Reasoning-Schritte zwischen Tool-Calls, mit Kontrolle pro Request und separatem Thinking-/No-Thinking-Modus. |
| Speculative Decoding & Quantisierung | Mitgeliefertes DFlash-Draft-Modell plus FP8-, NVFP4-, INT4- und GGUF-Varianten. |
Vorteile & Nachteile
Vorteile
- Open Weights zum SelbsthostenDie Gewichte von Laguna S 2.1 sind unter der OpenMDW-1.1-Lizenz auf Hugging Face verfügbar und laufen quantisiert auf einer einzelnen NVIDIA DGX Spark. Vollständig lokale Ausführung möglich!
- Sehr günstiger API-PreisMit $0,10 / $0,20 pro 1 Mio. Input-/Output-Token liegt Laguna S 2.1 weit unter proprietären Flaggschiffen. Über OpenRouter gibt es zusätzlich ein kostenloses Tier (mit etwas kleinerem Kontextfenster).
- Starke Coding-Benchmarks trotz kompakter GrößeLaguna S 2.1 erreicht 70,2 % in Terminal-Bench 2.1, 59,4 % in SWE-Bench Pro und 78,5 % auf SWE-Bench Multilingual bei nur ~8 Mrd. aktiven Parametern. Damit liegt das Modell auf Augenhöhe mit teils mehrfach größeren und proprietären Modellen.
- Großes Token-KontextfensterDas Kontextfenster von 1 Mio. Tokens deckt große Codebases und Aufgaben über lange Zeithorizonte in einem Durchgang ab.
- Effiziente MoE-Architektur118B-A8B-MoE mit nur ~8 Mrd. aktiven Parametern pro Token senkt die Inference-Kosten stark.
Nachteile
- Nur Text – keine MultimodalitätLaguna S 2.1 ist ein reines Text-2-Text-Modell. Bild-, Audio- oder Video-Input unterstützt es nicht, für multimodale Aufgaben brauchst du ein anderes Modell.
- Hoher Speicherbedarf ohne QuantisierungDer BF16-Checkpoint umfasst rund 236 GB. Ohne Quantisierung ist der Betrieb nur über Datacenter- oder Multi-GPU-Setups praktikabel.
- Auf Coding spezialisiertDas Modell ist auf Agentic Coding und Software-Engineering zugeschnitten und kein generalisierter Allrounder. Für breite Chat-, Wissens- oder Kreativaufgaben ist es weniger geeignet.
- Kein veröffentlichter Knowledge CutoffPoolside nennt für Laguna S 2.1 kein Datum der letzten Trainingsdaten. Wie aktuell das eingebaute Wissen ist, lässt sich nicht belegen, wäre aber durchaus relevant, da sich das Modell vollständig offline ausführen lässt.
Vergleiche Laguna S 2.1 mit anderen LLMs
Vergleiche Laguna S 2.1 mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.
Provider & APIs
Du kannst Poolside Laguna S 2.1 über die API folgender Anbieter nutzen.