← Blog

Kolibri-1 auf der NVIDIA DGX Spark: ein erster Vergleich mit Qwen3.6

Iristrace
Kolibri-1 auf der NVIDIA DGX Spark: ein erster Vergleich mit Qwen3.6

Von Iristrace B.V., mit André Kingham, CEO

Am 3. Oktober, dem Tag der Deutschen Einheit, hat das Heidelberger KI-Unternehmen Aleph Alpha Kolibri-1 veröffentlicht, ein offenes Sprachmodell, das gezielt für Deutsch und Englisch entwickelt wurde. Uns war das Modell schon einen Tag früher aufgefallen: Die Modellseite stand bereits am 2. Oktober auf Hugging Face, wenn auch noch ohne das Modell selbst – beim Sichten der neuen Repositories des Vortags sind wir darauf gestoßen.

Der Kolibri ist der kleinste Vogel der Welt. Die Modellkarte setzt bei der Hardware dennoch hoch an. Wörtlich heißt es dort: „Model memory footprint: ~78 GB (FP8 weights). Minimum: 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 or 1× B300. Recommended: 2× H100 SXM5, 2× H200, 1× B200 or 1× B300.“ Das sind Rechenzentrums-GPUs, wie sie in großen Servern stecken. Laut Modellkarte, und nicht nur des Namens wegen, sollte nach unserer Überlegung auch ein kleineres Gerät genügen: Rund 78 GB passen in die 128 GB einer DGX Spark.

Uns interessierten zwei Fragen: Läuft Kolibri-1 auf einer DGX Spark – ja oder nein? Und wie gut bewältigt es die Aufgabe, die unsere Kunden einem Assistenten tatsächlich stellen – die richtigen Informationen in den eigenen Dokumenten zu finden und zu nutzen –, verglichen mit Qwen3.6?

Kurz nach der offiziellen Veröffentlichung sind wir also selbst diesen Fragen nachgegangen: auf einer unserer DGX-Spark-Workstations von NVIDIA – kompakte Geräte im Schreibtischformat mit Grace-Blackwell-Chip, montiert in unseren Server-Racks – und an Aufgaben, wie sie auch unsere Kunden stellen, im direkten Vergleich mit Qwen3.6-35B-A3B, beide in FP8, auf baugleicher Hardware und durch dieselbe Pipeline.

Wir haben KI auf die Frage angesetzt, um das Potenzial auszuloten: eine von KI verfasste Testbibliothek, KI-Prüfer, 1.428 Antworten. Was sich dabei zeigt, ist Potenzial – und Potenzial muss sich in der Praxis bestätigen, an den Dokumenten und Fragen unserer Kunden. Zwei Tage intensiver Arbeit – eine erste Begegnung mit dem Modell.

Die Kurzfassung

  • DGX Spark, ja oder nein? Ja – vom ersten Tag an. Kolibri-1 läuft auf einer einzigen DGX Spark: mit dem Plugin von Aleph Alpha für den Inferenzserver, ohne Codeänderung, ohne Feinabstimmung. Die Modellkarte nennt als Minimum wörtlich „2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 or 1× B300“.
  • Antworten aus Dokumenten: Gleichstand auf Augenhöhe. Mit Suche und ohne Denkmodus erreichen beide 0,55 Punkte je Antwort nach dem ersten Prüfer, 0,50 gegen 0,47 nach einem unabhängigen zweiten – bei jeder Sampling-Einstellung. Kolibri-1 braucht dafür mehr Runden und liest mehr: typischerweise vier Modellrunden und fünf Werkzeugaufrufe je Antwort gegenüber zwei und zwei bei Qwen3.6.
  • Gleichstand im Mittel, nicht bei jeder Frage. Bei zwei der siebzehn Fragen unterscheiden sich die Modelle weit jenseits des Zufalls, und zwar in entgegengesetzte Richtungen. Kolibri-1 fand die strengere 90-Tage-Regel eines Kunden in 11 von 14 Antworten, Qwen3.6 in einer – weil Kolibri-1 weitersuchte. Qwen3.6 erkannte in allen 14, dass laut Vertrag ein Schmierfett gekauft wird, das nicht mehr freigegeben ist; Kolibri-1 sah es und schloss in 11 dennoch auf „freigegeben“. Gleicher Mittelwert, verschiedene Stärken.
  • Mit Denkmodus lag Kolibri-1 in beiden Durchläufen leicht vorn – allerdings zu einem Preis. 0,65 gegen 0,58 mit Suche nach dem ersten Prüfer, 0,60 gegen 0,51 nach dem zweiten: ein Vorsprung, der sich vom Zufall noch nicht unterscheiden lässt. Eine Antwort dauerte dann, unter unserer Testlast, im Median fünf Minuten, bei Qwen3.6 anderthalb.
  • Der deutlichste Unterschied liegt im Verhalten, nicht in der Trefferquote. Liefert die Suche nichts, wiederholt der Denkmodus von Kolibri-1 sie mit immer neuen Formulierungen, bis ein Rundenbudget ihn stoppt; in einer Testumgebung ohne Rückfallantwort hieß das: gar keine Antwort. Solches Verhalten beobachtet man, misst es und fängt es mit einer Antwortstrategie ab – ein Grund, ein Modell auszuschließen, ist es nicht. Und genau das zeigt kein Benchmark-Wert.
  • Suchen ist günstiger, nicht genauer. Passt die Bibliothek in den Prompt, antwortete das Modell mit allen Dokumenten vor Augen in drei von vier Konstellationen gleich gut oder besser. Die Suche spart bis zu zwei Drittel der Tokens und trägt auch dann noch, wenn die Bibliothek das Kontextfenster sprengt.
  • Eine Lücke in der Bibliothek führt nicht zu „Ich weiß es nicht“. Als unsere Suche das eine Dokument mit der Antwort verfehlte, waren alle 34 Antworten auf diese Frage selbstsicher und unvollständig; keine einzige sagte, die Bibliothek decke das nicht ab. Die Abdeckung ist Teil der Antwort, gleich welches Modell sie gibt.
  • Die Herkunft eines Modells ist eine strategische Entscheidung geworden. Mit Kolibri-1 steht neben amerikanischen, chinesischen und französischen Modellen ein leistungsfähiges deutsches zur Wahl. Für viele Unternehmen ist das eine Lieferkettenfrage, nicht nur eine Leistungsfrage.

Was uns zu diesem Test bewogen hat

In den Dokumenten unserer Kunden stecken Verträge, Verfahrensanweisungen, Qualitätsnachweise und Personalregelungen. Fragen sie uns nach KI, interessiert sie selten zuerst deren Leistungsfähigkeit, sondern vielmehr, wohin ihre Dokumente gelangen.

Offene Modelle verändern die Antwort auf diese Frage. Veröffentlicht ein Hersteller das Modell selbst, lässt es sich auf Hardware betreiben, die Sie kontrollieren – ohne dass auch nur ein Dokument an einen externen KI-Dienst übermittelt wird. Unter einer Lizenz wie Apache 2.0 können Sie es zudem weiter betreiben, unabhängig davon, wie der Hersteller künftig entscheidet.

Die meisten leistungsfähigen offenen Modelle stammen heute aus den USA und aus China; Qwen3.6 ist eines davon. Europa ist bislang schwächer vertreten, und nur wenige dieser Modelle wurden eigens für die deutsche Sprache entwickelt. Ein leistungsfähiges Modell aus Heidelberg ist daher für Organisationen interessant, die ihren KI-Anbieter ebenso wie ihre Daten lieber in Europa wissen.

Eine europäische Adresse allein beantwortet allerdings noch keine Frage. Ob ein Modell den Anforderungen unserer Kunden genügt, zeigt sich nur an deren Aufgaben – also haben wir es daran ausprobiert.

Warum gerade diese beiden Modelle

Beide sind offene Modelle unter der Apache-2.0-Lizenz, beide lassen sich auf eigener Hardware betreiben, und beide folgen derselben Architektur (Mixture of Experts): ein großes Modell, von dem pro Wort nur ein kleiner Teil rechnet, rund 3 Milliarden Parameter. Deshalb arbeiten beide auch auf vergleichsweise bescheidener Hardware zügig.

Betrieben haben wir beide in FP8: Jede Zahl des Modells wird mit acht statt sechzehn Bit gespeichert, was den Speicherbedarf halbiert. Beide Hersteller veröffentlichen ihre Modelle in diesem Format; jedes Modell lief also in der Fassung seines Herstellers, nicht in der eines Drittanbieters.

Kolibri-1 ist für genau diese Aufgabe gebaut. Seine Modellkarte nennt unter den vorgesehenen Einsatzzwecken „retrieval-augmented generation“, „long-document processing“ und „agentic tool calling“ und hält es für „question-answering systems over an organisation’s own material“ geeignet. Genau das haben wir getestet.

Qwen3.6 ist kein leichter Gegner. Die Qwen-Familie von Alibaba ist zum Arbeitspferd der offenen KI geworden: Zu ihr greifen viele Teams zuerst, wenn sie ein Modell selbst betreiben, und sie bildet die Grundlage vieler abgeleiteter Modelle weltweit. NVIDIA etwa hat mehrere seiner Qwen3-Nemotron-Modelle aus Qwen3 abgeleitet und veröffentlicht eine eigene komprimierte Fassung genau des Qwen3.6, das wir getestet haben. Selbst sein Nemotron 3 Nano, auf NVIDIAs eigener Architektur gebaut, wurde laut Modellkarte unter anderem mit Qwen-Modellen verbessert („improved using“). Diese Ausgabe liest zudem Bilder und deckt ein breites Sprachspektrum ab.

Unsere eigenen Erfahrungen mit dem Modell sind überwiegend gut. So betrachtet hat ein Neuling, der auf den Dokumenten eines Unternehmens auch nur mit ihr gleichzieht, eine hohe Hürde genommen – und genau das wollten wir uns näher ansehen.

Kolibri-1Qwen3.6 (35B-A3B)
HerstellerAleph Alpha Research GmbH, HeidelbergQwen Team, Tongyi Lab der Alibaba Group
VeröffentlichtOktober 2026April 2026
Größe, gesamt / aktiv pro Wort78 Milliarden / 3,5 Milliarden35 Milliarden / 3 Milliarden
Sprachenoffiziell Deutsch und Englischein breites Spektrum
Liest Bilderneinja (hier nicht verglichen)
Längste Eingabe262.144 Tokens262.144 Tokens
Mindest-Hardware laut Modellkarte„2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 or 1× B300“nicht angegeben
Modellkarte auf Hugging FaceAleph-Alpha/Kolibri-1Qwen/Qwen3.6-35B-A3B-FP8

Die Testumgebung: die Wissensbasis von Iristrace Docs

Iristrace Docs verwandelt Dokumente in verwertbare Daten: Aus einer Rechnung oder einem Lieferschein werden strukturierte Felder, zugeordnet den richtigen Konten und Codes in Systemen wie SAP Business One. Angebunden werden die Orte, an denen Dokumente ohnehin liegen, darunter SharePoint sowie Exchange- und Gmail-Postfächer. Der Schritt, an dem wir derzeit arbeiten, ist eine Wissensbasis, die sich befragen lässt – per Chat und auch per Sprache, mit gesprochener Antwort – und die aus den eigenen Dokumenten eines Unternehmens antwortet. Der Test lief auf dieser Wissensbasis in ihrem heutigen Stand. Dies ist keine Produktvorstellung, sondern ein Bericht darüber, was wir beim Betrieb zweier Modelle darin gelernt haben.

Hervorgehoben: in diesem Test verwendet

Iristrace Docs

Web-App

KI-Chat · Dokumenten-Upload · Zugriffsverwaltung

Iristrace Docs

Mobile App

Chat · Ticketerfassung und Qualitätsprozesse · Spracheingabe

Iristrace DocsEine Plattform, in unserer Cloud oder in Ihrer eigenen Infrastruktur

Arbeitsbereiche: Entwicklung · Personal · Qualität · Einkauf · Finanzen · …

Berechtigungen pro Benutzer und Arbeitsbereich, bei jeder Abfrage

KI-Funktionen

  • RAGAntworten aus dem Text der Dokumente, mit Quellenangaben
  • WerkzeugaufrufeSuchen, Dokumente öffnen, das Data Warehouse abfragen
  • KI-ExtraktionDokument → strukturierte Daten (JSON) und Text (Markdown); für Scans und Fotos ist ein Vision-Modell nötig

Speicher

  • TextspeicherJedes Dokument vollständig, als Markdown
  • DatensatzspeicherExtrahierte Daten, als JSON
  • Data WarehouseTabellen, automatisch aus den Datensätzen erzeugt
  • VektorspeicherDer Suchindex, einer je Arbeitsbereich

Integrationen

  • SharePointDer Ablageort der Dokumente. Abruf über Microsoft Graph; der Synchronisierer, der Änderungen in einer Bibliothek oder einem Ordner selbstständig erkennt, ist in Entwicklung. Wer was lesen darf, legt der Arbeitsbereich fest
  • SAP Business OneErmittelt das richtige Sachkonto und die SAP-Codes für Geschäftspartner, Artikel und mehr
  • Exchange- und Gmail-Postfächer
  • Webhooks
  • Transkriptionen
  • Iristrace Checks
  • Weitere, gemeinsam mit unseren Kunden entwickelt

Der Prompt enthält nur den Kontext, den der Benutzer sehen darf

Privates LLM

Text und Bild: ein Modell für beides, etwa Qwen oder Mistral, oder zwei Modelle nebeneinander

  • LiteLLMModell-Router
  • NVIDIA DGX Spark 1Kolibri-1 in diesem Test
  • NVIDIA DGX Spark 2Qwen3.6 in diesem Test; zuvor das Vision-Modell, das die Scans gelesen hat
Iristrace Docs unter der Haube.

Das Prinzip umfasst fünf Schritte, und der Test hat alle fünf durchlaufen:

  1. Anbinden. Die Dokumente bleiben, wo sie sind. In diesem Test war das eine SharePoint-Bibliothek, einmalig über Microsoft Graph abgerufen. Der Synchronisierer, der eine geänderte Datei erkennt und nur diese erneut abruft, ist in Entwicklung.
  2. Lesen. Jede Datei wird in Text überführt, ob Word, PDF oder Tabelle. Gescannte Seiten erschließt ein Vision-Modell, das auf unserer eigenen Hardware läuft. Jedes Dokument bleibt dabei vollständig erhalten, als Markdown, nicht nur in Auszügen. Dieser Textspeicher ist die Grundlage der Wissensbasis.
  3. Indexieren. Die Dokumente werden entlang ihrer Überschriften in Abschnitte gegliedert und für die Suche indexiert, jeder Arbeitsbereich in einem eigenen Index.
  4. Antworten. Der Assistent sucht, öffnet bei Bedarf ganze Dokumente und antwortet mit Quellenangaben, die jeweils zum Abschnitt und zur Originaldatei führen.
  5. Berechtigungen. Der Arbeitsbereich bildet die Grenze: Antworten erhält jede Person nur aus Arbeitsbereichen, für die sie berechtigt ist – durchgesetzt von der Datenbank selbst, nicht allein von der Anwendung darüber. Da sich ein Arbeitsbereich aus einem einzelnen Ordner einer SharePoint-Site speisen lässt, kann der Leserkreis auf die zuständige Gruppe beschränkt werden. Die Berechtigungslisten von SharePoint übernehmen wir bewusst nicht: Eine klare Grenze ist leichter nachzuvollziehen und zu prüfen.

Zudem kennt der Assistent den Inhalt eines Arbeitsbereichs. Fällt eine Frage aus diesem Rahmen, weist er darauf hin, statt endlos weiterzusuchen.

In diesem Test lief jeder Schritt auf unserer eigenen Hardware: das Lesen der Scans, die Indexierung, die Suche und die Beantwortung. Externe Dienste waren SharePoint von Microsoft, wo die Bibliothek lag, wie sie auch bei einem Kunden läge, sowie zwei KI-Modelle anderer Hersteller: Claude von Anthropic verfasste die fiktiven Dokumente und die Tests und bewertete jede Antwort; GPT-6.1 Sol von OpenAI bewertete jede Antwort ein zweites Mal, unabhängig und blind. Beide arbeiteten ausschließlich mit synthetischem Material – aus gutem Grund: Nur bei Dokumenten, deren Inhalt und Mängel wir selbst festgelegt haben, wissen wir mit Sicherheit, welche Antwort richtig ist.

Der Test: ein fiktives Unternehmen mit ganz realen Problemen

Quizfragen interessierten uns nicht. Wir wollten wissen, ob die Modelle Beschäftigten weiterhelfen, die eine Frage zu den Regeln ihres eigenen Unternehmens haben – und dafür brauchten wir ein Unternehmen.

Unter unserer Anleitung hat Claude Opus 5.5 bei sehr hohem Denkaufwand (Extra High) die Dokumentenbibliothek eines fiktiven Herstellers verfasst: eines Wälzlagerherstellers für die Automobilindustrie, der zu einer größeren Gruppe gehört und Standorte in sechs Ländern unterhält. Entstanden sind 47 Dokumente – Richtlinien, Verfahrens- und Arbeitsanweisungen, technische Spezifikationen, Freigabematrizen und ein Liefervertrag – auf Englisch, Spanisch, Polnisch, Deutsch und Chinesisch, zusammen rund 160.000 Tokens Text.

Anschließend haben wir vorweggenommen, was die Zeit mit jeder echten Dokumentenbibliothek anrichtet: Wir haben 18 Mängel eingebaut und jeden davon in einem Lösungsschlüssel dokumentiert. Einige Beispiele:

  • Zwei Revisionen der Reisekostenrichtlinie in derselben Bibliothek, mit unterschiedlichen Obergrenzen für Hotelkosten.
  • Zwei Dokumente, die derselben Führungskraft unterschiedliche Freigabegrenzen einräumen.
  • Eine Verfahrensanweisung, die auf eine nicht existierende Checkliste verweist.
  • Die Arbeitsanweisung eines Werks, die stillschweigend von der Konzernspezifikation abweicht.
  • Eine Kundenanforderung, die über die eigene Verfahrensanweisung hinausgeht.
  • Ein regionales Personaldokument, das von einer Gesetzesänderung überholt wurde.

Ein weiteres Dokument wurde zwar verfasst, aber bewusst nicht in die Bibliothek aufgenommen – um zu prüfen, ob ein Modell einräumt, dass die Bibliothek ein Thema nicht abdeckt, statt etwas zu erfinden.

Aufschlussreich war ein Detail: Die KI, die die Bibliothek verfasst hat, hatte von sich aus weitere, nicht vorgesehene Widersprüche eingebaut. Ein zweiter Prüfdurchgang spürte 18 davon auf, die wir wieder entfernt haben. So blieben nur die bewusst eingeplanten Fallstricke im Spiel.

Warum dieser Aufwand? Ein Dokumentenassistent, der eine Hotelobergrenze von 120 € nennt, weil er zuerst auf die veraltete Revision gestoßen ist, richtet mehr Schaden an, als er nützt. Entscheidend ist nicht, ob ein Modell gut formuliert, sondern ob es bemerkt, dass etwas nicht zusammenpasst.

Vom Text zur echten Dokumentenbibliothek

Die Dokumente zu verfassen, war nur die halbe Arbeit. Die andere Hälfte bestand darin, sie wie echte Dateien in einem echten System zu behandeln.

Jedes Dokument liegt in dem Format vor, das ein reales Unternehmen verwenden würde: überwiegend Word, daneben PDF, für die Matrizen Excel. Drei Dokumente wurden zu Scans verarbeitet – leicht schräg, mit Störflecken und als reine Bilddateien ohne Textebene, sodass sich der Inhalt nur durch Lesen der Seite erschließt. Jedes Dokument trägt einen Dokumentenkopf mit den Lenkungsangaben (Nummer, Revision, Verantwortlicher, Freigabe, gültig ab, nächste Überprüfung), und zwar in einem von zwei Hausstilen, weil Gruppe und Tochtergesellschaft ihre Dokumente unterschiedlich gestalten.

Anschließend haben wir die Bibliothek auf eine SharePoint-Site für Demozwecke hochgeladen, mit einem Ordner je Abteilung, und von dort in Iristrace Docs geladen.

Bevor ein Modell auch nur eine Frage sah, prüfte ein Skript, ob sich jeder Fakt aus dem Lösungsschlüssel im konvertierten Text wiederfinden ließ, die Scans eingeschlossen. Verfehlte ein Modell einen Fakt, lag es also nicht an fehlenden Daten.

Eine Aufgabe, auf drei Wegen ausprobiert

Eine Tabelle mit Benchmark-Ergebnissen suchen Sie hier vergeblich; solche Werte veröffentlichen die Hersteller selbst. Wir haben die eine Aufgabe geprüft, mit der Beschäftigte einen Dokumentenassistenten am häufigsten betrauen: eine Frage aus den eigenen Unternehmensdokumenten beantworten – und dabei richtig liegen, wenn sich die Dokumente widersprechen. Extraktion und strukturierte Datenanalyse gehören ebenfalls zu Iristrace Docs, waren aber nicht Teil dieses Tests; mehr dazu am Ende.

Antworten aus Ihren Dokumenten: auch das zweite Dokument lesen

Diese Aufgabe meinen die meisten, wenn von KI für Unternehmensdokumente die Rede ist: Bevor der Assistent antwortet, durchsucht er die Bibliothek, wertet die Treffer aus und belegt seine Antwort mit Quellen. Fachleute sprechen von „Retrieval-Augmented Generation“, kurz RAG.

Wir haben 17 Fragen gestellt, wie sie im Arbeitsalltag vorkommen, jede mit hinterlegtem Lösungsschlüssel. Einige Beispiele:

  • Darf ich ein Geschenk eines Lieferanten im Wert von 75 € annehmen? Verhaltenskodex der Gruppe und Einkaufsrichtlinie vor Ort nennen unterschiedliche Grenzen; eine richtige Antwort führt beide an.
  • Wie hoch ist die aktuelle Obergrenze für Hotelkosten auf Dienstreisen? In der Bibliothek liegt noch eine ältere Revision mit niedrigerer Grenze.
  • Mit welchem Vorlauf müssen wir einen bestimmten Kunden über eine Produktänderung informieren? Die Anforderungen des Kunden gehen über die allgemeine Verfahrensanweisung hinaus.
  • Was geschieht, wenn ein Lieferant seinen Konfliktmineralien-Bericht nicht einreicht? Das Dokument mit der Antwort ist das zurückgehaltene. Richtig ist hier: „Die Bibliothek deckt dieses Thema nicht ab.“

Als richtig galt eine Antwort nur, wenn sie den entscheidenden Fakt und den dahinter eingebauten Widerspruch benannte; der richtige Fakt ohne Hinweis auf den Widerspruch zählt als teilweise richtig.

Jede Frage wurde auf Englisch und auf Deutsch gestellt, mit drei Sampling-Einstellungen (der festen Einstellung unseres Chats, einer niedrigen Temperatur und der Empfehlung des Herstellers), mit und ohne Denkmodus und ein- bis dreimal je Einstellung: insgesamt 1.428 Antworten. Jede Antwort wurde gemischt, anonymisiert und blind anhand des Lösungsschlüssels bewertet, und zwar doppelt: von Agenten mit Claude Opus 5.5 und unabhängig davon von GPT-6.1 Sol von OpenAI. Die beiden Prüfer stimmten in 78 % der Bewertungen überein (Cohens Kappa 0,68). Der zweite legte strengere Maßstäbe an, wie vollständig eine richtige Antwort sein muss; wo er zu einem anderen Bild kommt, sagen wir es.

Mit Suche, so wie das Produkt arbeitet. Anteile an allen Antworten, zuerst der erste Prüfer, in Klammern der zweite:

Kolibri-1Qwen3.6
Richtig / teilweise / falsch, ohne Denkmodus42 % / 26 % / 32 % (32 / 36 / 32)45 % / 21 % / 34 % (28 / 38 / 34)
Punkte je Antwort im Mittel, ohne Denkmodus0,55 (0,50)0,55 (0,47)
Sekunden je Antwort, Median, ohne Denkmodus, unter Testlast5532
Richtig / teilweise / falsch, mit Denkmodus (Kolibri-1 auf high)60 % / 10 % / 29 % (49 / 22 / 29)50 % / 16 % / 34 % (35 / 32 / 32)
Punkte je Antwort im Mittel, mit Denkmodus0,65 (0,60)0,58 (0,51)
Sekunden je Antwort, Median, mit Denkmodus, unter Testlast32182

Punkte je Antwort: richtig 1, teilweise ½, falsch 0. Jede Antwort wurde doppelt bewertet. Ohne Denkmodus: 238 Antworten je Modell. Mit Denkmodus, Kolibri-1 auf high, seiner teuersten Stufe: 68 Antworten je Modell, zwei Durchläufe. Die Sekunden sind Mediane unter unserer Testlast, die auf dem Server von Kolibri-1 den größten Teil des Tages höher war als auf dem von Qwen3.6: Vergleichen Sie sie innerhalb eines Modells, nicht zwischen beiden. Eine Geschwindigkeitsmessung mit einzelnen Anfragen auf ruhigen Servern folgt. Dieselben Werte Frage für Frage stehen in Anhang E.

Ohne Denkmodus herrscht Gleichstand, und er hängt nicht von der Sampling-Einstellung ab: Bei Temperatur 0, bei 0,3 und bei der Empfehlung des jeweiligen Herstellers wechselt die Führung um wenige Hundertstel. Frage für Frage liegt Qwen3.6 nach dem ersten Prüfer bei acht Fragen vorn und Kolibri-1 bei fünf, nach dem zweiten Prüfer steht es sechs zu sechs; der mittlere Unterschied je Frage beträgt 0,00 nach dem ersten Prüfer und 0,03 zugunsten von Kolibri-1 nach dem zweiten, jeweils mit einem 95-%-Intervall von etwa ±0,12 (Anhang D). Kolibri-1 wendet für dasselbe Ergebnis mehr auf: Eine typische Antwort kostet es vier Modellrunden und fünf Werkzeugaufrufe, gegenüber zwei und zwei bei Qwen3.6, und jede Runde sendet Anweisungen, Werkzeuge und alles bisher Gefundene erneut – insgesamt liest es so rund 86.000 Prompt-Tokens je Antwort, gegenüber 53.000. Das, mehr als alles, was die Server beitragen, erklärt die längere Antwortzeit.

Mit Denkmodus lag Kolibri-1 leicht vorn, in beiden Durchläufen und nach beiden Prüfern. Frage für Frage führt es bei sechs, liegt bei ein bis zwei zurück, und die übrigen enden unentschieden; der mittlere Unterschied je Frage beträgt 0,07 bis 0,08 zu seinen Gunsten, und das 95-%-Intervall endet nach dem zweiten Prüfer bei null und schließt die Null nach dem ersten nur knapp aus. Der zweite Durchlauf hat den Vorsprung verkleinert. „Leicht vorn“ ist also das, was die Daten tragen, „antwortet besser“ nicht – und angesichts der Zahl unserer Vergleiche (Anhang D) ist es eine Richtung, die die nächsten Tests bestätigen müssen. Und es hat seinen Preis: unter unserer Testlast im Median über fünf Minuten je Antwort, etwa ein Viertel der Antworten über zehn Minuten. Qwen3.6 bleibt mit Denkmodus im Median unter anderthalb Minuten.

Gleichstand im Mittel, nicht bei jeder Frage

Der Gleichstand ist ein Mittelwert, und er verdeckt zwei Fragen, bei denen sich die Modelle weit jenseits des Zufalls unterscheiden: die einzigen zwei von siebzehn, deren Unterschied unter beiden Prüfern standhält, wenn man für die Zahl der verglichenen Fragen korrigiert (Anhang D). Sie weisen in entgegengesetzte Richtungen.

Die strengere Regel des Kunden: Kolibri-1 liest richtigerweise das zweite Dokument. Mit welcher Vorlaufzeit müssen wir HallvikDemo Trucks vor einer Produktänderung informieren? Die allgemeine Verfahrensanweisung für Änderungen nennt 60 Tage, die Matrix der Kundenanforderungen für diesen Kunden 90. Kolibri-1 antwortete in 11 von 14 Fällen richtig, Qwen3.6 in 1 von 14 (12 gegen 2 nach dem zweiten Prüfer), auf Englisch wie auf Deutsch. Lesen können beide den Widerspruch: Mit nur den richtigen Dokumenten im Prompt lagen beide jedes Mal richtig. Der Unterschied liegt in der Suche. Qwen3.6 suchte meist ein einziges Mal und antwortete aus der Verfahrensanweisung; viermal erklärte es, die Dokumente erwähnten HallvikDemo nicht, obwohl die Matrix unter seinen eigenen Suchergebnissen war. Kolibri-1 brauchte drei bis vier Runden und fand die Matrix. Hier haben die zusätzlichen Runden, die wir oben als Kosten verbucht haben, die richtige Antwort erst möglich gemacht – bei genau der Art von Frage, die Qualitäts- und Compliance-Verantwortliche umtreibt. Mit Denkmodus suchte Qwen3.6 gründlicher und lag in zwei von vier Fällen richtig.

Ein nicht mehr freigegebenes Schmierfett: Kolibri-1 zieht den falschen Schluss. Welche Fettsorte kaufen wir laut Vertrag bei ChemcoDemo, und ist es die freigegebene? Der Liefervertrag nennt eine Fettsorte, die laut Spezifikation nicht mehr freigegeben ist. Qwen3.6 lag in allen 14 Antworten richtig. Kolibri-1 war in 3 vollständig richtig. In den übrigen 11 bemerkte es, dass der Vertrag die nicht mehr freigegebene Sorte WH-2 nennt, und kam dennoch – meist schon im ersten Satz – zu dem Schluss, der Einkauf sei freigegeben. Wer nach der ersten Zeile aufhört zu lesen, wird in die Irre geführt. Mit nur den richtigen Dokumenten im Prompt lag auch Kolibri-1 hier jedes Mal richtig – mit Denkmodus ebenso mit Suche, in allen vier Antworten.

Eine dritte Frage trennt die beiden nur nach dem ersten Prüfer: die Erstbestellung vor dem Konfliktmineralien-Bericht eines Lieferanten (Frage 17). Dieser Unterschied misst unseren Lösungsschlüssel, nicht die Modelle. Der Schlüssel belohnt ein entschiedenes „Nein“, das die Bibliothek nicht stützt, und Kolibri-1 antwortete meist, die Dokumente beantworteten die Frage nicht (siehe die Grenzen weiter unten).

Bei vierzehn Antworten je Modell und Frage sind das Verhaltensweisen bei zwei Fragen, keine Rangfolge. Sie zeigen aber, dass zwei Modelle mit gleichem Mittelwert nicht austauschbar sind: Welches Ihnen besser dient, hängt von den Fragen ab, die Ihre Beschäftigten stellen – und das lässt sich nur an den eigenen Dokumenten herausfinden.

Warum nicht die gesamte Bibliothek in den Prompt laden?

Beide Modelle verarbeiten 262.144 Tokens auf einmal, mehr als unsere gesamte Bibliothek umfasst. Naheliegend wäre es also, auf die Suche zu verzichten, sämtliche Dokumente in den Prompt aufzunehmen und das Modell die Antwort selbst finden zu lassen – dann kann keine Suche etwas übersehen. Genau das haben wir mit beiden Modellen erprobt.

Punkte je Antwort im Mittel, erster Prüfer (zweiter Prüfer)Mit SucheGesamte Bibliothek im Prompt
Kolibri-1, ohne Denkmodus0,55 (0,50)0,51 (0,44)
Qwen3.6, ohne Denkmodus0,55 (0,47)0,67 (0,54)
Kolibri-1, mit Denkmodus0,65 (0,60)0,73 (0,63)
Qwen3.6, mit Denkmodus0,58 (0,51)0,67 (0,56)

Wir hatten erwartet, dass die Suche gewinnt. Sie gewann nicht. Mit der gesamten Bibliothek vor Augen antwortete Qwen3.6 ohne Denkmodus deutlich besser, um 0,11 bis 0,16 je Frage, und das gilt unter beiden Prüfern; es ist der eine klare Unterschied im Lesen zwischen den beiden. Beide Modelle antworteten mit Denkmodus besser. Die Suche lag nur bei Kolibri-1 ohne Denkmodus vorn. Die ehrliche Erkenntnis lautet daher: Suchen ist günstiger, nicht genauer. Eine Frage mit der gesamten Bibliothek im Anhang kostet rund 150.000 Prompt-Tokens, mit Suche 53.000 bis 86.000, über alle Runden einer Antwort summiert. Und der Ansatz mit der gesamten Bibliothek trägt nur so lange, wie die Bibliothek in das Kontextfenster passt – bei einem realen Unternehmen also nicht lange.

Das erste Einlesen der gesamten Bibliothek dauerte auf beiden Servern rund eine Minute (62 bis 68 Sekunden). Danach begannen die Antworten binnen zwei bis vier Sekunden, weil der Server vorhält, was er bereits gelesen hat. Die Prompts mit der gesamten Bibliothek waren zugleich der Ort der wenigen entgleisten Antworten ohne Denkmodus: Sechs von 68 bei der festen Einstellung begannen, sich zu wiederholen, oder liefen in die Ausgabegrenze.

Unsere eigenen Hausaufgaben

Drei Dokumente bereiteten Schwierigkeiten, gleich welches Modell antwortete. Eine Verfahrensanweisung zur Problemlösung (8D) fand die Suche in 35 Versuchen kein einziges Mal. Eine gescannte Verfahrensanweisung fand sie 8-mal in 35 Versuchen. Eine Kundenanforderungsmatrix bei der Frage, die sie benötigt, 9-mal in 35. Das ist nicht dem Modell anzulasten, sondern uns – und genau dort setzen wir als Nächstes an: Die 8D-Verfahrensanweisung nennt die Person, nach der eine Frage fragt, nur ein einziges Mal, und eine Suche nach Bedeutung stufte jedes Mal andere Abschnitte höher ein. Eine Suche, die zusätzlich exakte Wörter abgleicht, würde das Dokument sehr wahrscheinlich finden.

Lehrreicher ist, wie sich die Modelle verhielten, als die Suche das Dokument verfehlte. Von den 34 Antworten auf diese Frage waren alle 34 teilweise richtig: Jedes Modell antwortete aus den Dokumenten, die es gefunden hatte, mit einer plausiblen, aber unvollständigen Angabe. Kein einziges Mal hieß es „Ich weiß es nicht“. So sieht eine Lücke in der Bibliothek aus Sicht der Benutzer aus: nicht als zögerliche Antwort, sondern als selbstsichere.

Das zurückgehaltene Dokument ist das Gegenbeispiel. Zu einem Thema befragt, das die Bibliothek nicht abdeckt, sagten beide Modelle das meist auch: Kolibri-1 in 26 von 36 Antworten, Qwen3.6 in 30 von 42. Findet sich gar nichts, räumen es beide ein. Findet sich etwas beinahe Passendes, tut es keines.

Der deutlichste Unterschied liegt im Verhalten

Neben den Fragen haben wir acht kleine Agentenszenarien mit nachgebildeten Werkzeugen durchgespielt, je fünf Durchläufe, auf Englisch und Deutsch, mit und ohne Denkmodus. Sie stellen Fehler nach, die wir aus dem Produktivbetrieb kennen: eine Suche ohne Treffer, ein Werkzeug mit wiederholten Zeitüberschreitungen, ein als Text geschriebener statt ausgeführter Werkzeugaufruf, eine lange Liste. Die Übersicht steht in Anhang E.

Der Denkmodus von Kolibri-1 versucht es immer wieder, wenn ein Werkzeug nichts zurückliefert. In den beiden Szenarien, in denen die Suche nichts findet oder immer wieder abbricht, wiederholte Kolibri-1 mit Denkmodus – auf der vom Hersteller evaluierten Stufe und mit dessen empfohlenem Sampling – die Suche mit immer neuen Formulierungen, bis die Rundenbegrenzung der Testumgebung griff; da diese Testumgebung keine Rückfallantwort kennt, blieb es in 6 von 10 englischen Durchläufen ohne Antwort. Die Aufrufe variieren, es ist nicht derselbe Aufruf in Wiederholung – und gelesen haben wir die Aufrufe, nicht die Denktexte, die die Testumgebung für diese Durchläufe nicht aufbewahrt hat. Auf einer niedrigeren Stufe des Denkmodus halbierten sich die Ausfälle auf 3 von 10. Ohne Denkmodus verschwanden sie auf Englisch fast ganz (1 von 20 gesampelten Durchläufen, keiner bei Temperatur 0), auf Deutsch nicht (6 von 20). Qwen3.6 mit Denkmodus und empfohlenem Sampling beantwortete 10 von 10 englischen Durchläufen und 9 von 10 deutschen. Die Schleife unseres Produkts verhält sich anders als die Testumgebung: Sie erzwingt eine abschließende Antwort, wenn ihr Budget erschöpft ist, und 77 der 78 Antworten, die dieses Budget erreichten, antworteten dennoch. Der eine Ausreißer des Haupttests – eine Frage an Kolibri-1, die 47 Minuten und neun Runden beanspruchte und dann unbeantwortet blieb – endete, bevor dieses Budget erreicht war.

Die Agentenszenarien liefen zusätzlich mit Denkmodus bei Temperatur 0, weil unser Testskript jedes Szenario mit beiden Sampling-Einstellungen durchläuft; für die Fragedurchläufe galt das nicht. Kein Hersteller empfiehlt diese Kombination: Beide veröffentlichen stattdessen Sampling-Einstellungen für den Denkmodus, und von Greedy Decoding in einer langen Gedankenkette ist bekannt, dass sie in Zyklen hoher Wahrscheinlichkeit gerät. Es geschah, was Sampling-Einstellungen verhindern sollen. In den beiden Szenarien blieb Kolibri-1 jeweils ohne Antwort (fünf nahezu identische Durchläufe je Szenario, also zwei Beobachtungen statt zehn), und in fünf der zehn Durchläufe dachte es bis an die Grenze von 32.768 Tokens, der längste 56 Minuten lang. Qwen3.6 beantwortete alle. Wir berichten es nur, weil ein Proxy oder eine Anwendung diese Kombination versehentlich senden kann: Es ist ein Hinweis für den Betrieb, kein Messwert, und unser Produkt sendet sie nie.

Ein größeres Token-Budget behebt das nicht: Die entgleisten Durchläufe überschritten auch 32.768 Tokens. Was hilft, ist ein Budget je Antwort in Zeit oder Tokens, eine Obergrenze für wiederholte Suchen ohne Treffer und eine Rückfallregel, die aus dem Gefundenen antwortet. Unsere Schleife begrenzt bereits auf zehn Runden und sechzehn Werkzeugaufrufe; danach muss ohne Werkzeuge geantwortet werden. 77 Antworten erreichten diese Grenze, und alle bis auf eine lieferten dennoch eine Antwort. Ein Zeitbudget kommt als Nächstes hinzu.

Wir werten das als Ausnahme der ersten Tage, nicht als Urteil. Kolibri-1 ist wenige Tage alt, sein Server-Plugin noch jünger. Die frühen Schwächen von Qwen3.6, die in diesem Test ausblieben (siehe unten), sind der Präzedenzfall. Modelle reifen, Server ziehen nach, und die Anwendung lernt, wovor sie sich schützen muss. Entscheidend ist, solches Verhalten zu beobachten, zu messen und mit Antwortstrategien abzufangen – nichts anderes sind die genannten Budgets.

Sprachliche Ausrutscher, in beide Richtungen. Auf Deutsch gefragt und ohne Denkmodus, antwortete Kolibri-1 in 15 von 119 Suchantworten auf Englisch, Qwen3.6 in 4. In den Agentenszenarien mit Denkmodus antwortete Kolibri-1 in 5 von 11 Fällen, in denen das Werkzeug nichts lieferte oder ausfiel, auf Deutsch – bei englischen Anweisungen und englischer Frage, aber spanischen Werkzeugergebnissen, der Sprache unserer Testdaten; Deutsch kam in keiner Eingabe vor. Ein Vorbehalt, den unser Aufbau Kolibri-1 schuldet: Unsere Antwortanweisungen sind unabhängig von der Sprache der Frage auf Englisch verfasst, und 34 der 48 Dokumente sind englisch. Eine deutsche Frage trifft also auf englische Anweisungen. Für einen internationalen Konzern ist das realistisch, und es ist unser Produkt, wie es heute gebaut ist – Kolibri-1 in seiner Heimatsprache ist es nicht. Die Sprache floss nicht in die Bewertung ein: Der Bewertungsmaßstab kennt kein Sprachkriterium, und keine Begründung eines Prüfers erwähnt sie. Die betroffenen Antworten schnitten zwar schlechter ab als die übrigen; das spricht dafür, dass der Sprachwechsel mit einer schwierigen Frage einhergeht, nicht dafür, dass er abgestraft wurde.

Die alten Schwächen von Qwen3.6 blieben aus. Auf der 4-Bit-Fassung, die vor diesem Test getestet wurde, waren uns in den Denktext geschriebene Werkzeugaufrufe und endloses Nachdenken begegnet. Auf dem abgestimmten FP8-Server enthielt keiner seiner Denktexte Werkzeugaufruf-Markup, und keiner seiner 160 Agentendurchläufe mit Denkmodus schrieb einen Aufruf als Text. Welche Änderung das behoben hat, können wir nicht sagen: Gewichte, Serverversion, Cache-Genauigkeit und spekulatives Decoding änderten sich gleichzeitig.

Eine kleine Schwäche hat Qwen3.6 dennoch. Auf Deutsch gefragt und ohne Denkmodus, begann es 10 von 119 Suchantworten mit einem verirrten <tool_call>-Tag und antwortete dann korrekt. Benutzer sehen dieses Tag, sofern die Anwendung es nicht entfernt. Keine seiner 119 englischen Antworten wies es auf. Die Modellkarte von Qwen3.6 merkt an, dass eine höhere Presence Penalty – wir haben die empfohlenen 1,5 verwendet – gelegentlich zu Sprachmischung und einer leicht geringeren Leistung führen könne; seine wenigen Antworten in der falschen Sprache und diese Tags sind vor diesem Hintergrund zu lesen.

Im Betrieb: eine DGX Spark pro Modell

Jedes Modell lief auf einer eigenen DGX Spark, einer Workstation im Schreibtischformat mit NVIDIAs GB10-Chip (Grace Blackwell) und 128 GB Speicher, den sich Prozessor und Grafikeinheit teilen; die Geräte sind in unseren Server-Racks montiert. Kolibri-1 belegt in FP8 rund 74 GiB davon und lässt dennoch Platz für neun Gespräche in voller Länge.

Die Installation war unkompliziert. Aleph Alpha liefert zum Modell ein Plugin für den Inferenzserver mit, und Kolibri-1 beantwortete am Tag seiner Veröffentlichung die ersten Fragen auf einer DGX Spark, ohne Änderung an unserem Code. Das Modell kam gut vorbereitet und passte auf Anhieb zu unseren Geräten. Bei Qwen3.6 war das seinerzeit nicht so. Der Server, der es unterstützte, lag nur als Release Candidate vor; die einzige passende Fassung war die 4-Bit-Komprimierung eines Drittanbieters; und die brauchte eine gepatchte Tokenizer-Datei, die jede Eingabe bei 4.096 Tokens abschnitt, bis wir die Ursache fanden. Das kostete uns Tage. Ein Teil davon lag an der Serversoftware von damals, die inzwischen nachgezogen hat.

Pro DGX SparkKolibri-1Qwen3.6
Speicher für das Modell73,6 GiB34,2 GiB
Vom Start bis zur ersten Antwort11 Minutenrund 8 Minuten
Cache für Gespräche2,4 Millionen Tokens7,0 Millionen Tokens
Gespräche beim vollen Fenster von 262.144 Tokens9rund 27
Modellrunden / Werkzeugaufrufe je Suchantwort, ohne Denkmodus, typisch (Median)4 / 52 / 2
Gelesene Prompt-Tokens je Suchantwort, über alle Runden summiert (rund 14.000 bzw. 9.000 je Runde)rund 86.000rund 53.000

Qwen3.6 hält auf demselben Gerät rund dreimal so viele lange Gespräche vor. Beide Modelle führen nur in 10 ihrer Schichten einen Cache, der mit dem Gespräch wächst; der Unterschied ist vor allem eine Frage des Platzes. Die Gewichte von Qwen3.6 belegen halb so viel Speicher, was doppelt so viel Raum für den Cache lässt. Der Rest ergibt sich daraus, wie der Server den jeweiligen Cache anlegt, was wir nicht analysiert haben. Um den Vergleich fair zu halten, haben wir beide Server auf acht gleichzeitige Anfragen begrenzt – das Maximum, das der Cache von Kolibri-1 beim vollen Fenster aufnimmt. Neun Gespräche sind der Extremfall, jedes mit dem vollen Fenster von 262.144 Tokens zugleich. Die meisten Gespräche sind weit kürzer: Eine Suchrunde in diesem Test umfasst rund 14.000 Tokens, und in dieser Größe fasst derselbe Cache weit über hundert davon. Der Test selbst stellte je Server nur vier Fragen zugleich, neben den Agentenszenarien; der Cache war nie die Grenze, und nur wenn auf dem Server von Kolibri-1 mehr als acht Anfragen zugleich liefen, stellte das Anfragelimit sie in die Warteschlange – ein Teil des Lastvorbehalts, der für jede Zeitangabe in diesem Artikel gilt.

Diese Werte gelten für den Auslieferungszustand. Optimiert haben wir nichts; der Server selbst bringt für die Schichtform von Qwen3.6 auf diesem Chip eine abgestimmte Kernel-Konfiguration mit, für Kolibri-1 keine – jeder Geschwindigkeitsunterschied begünstigt Qwen3.6 also auch aus diesem Grund. Zudem weist der Server darauf hin, dass sein speichersparendes Cache-Format bei beiden Modellen unkalibriert läuft. Beim Tempo und womöglich auch bei der Genauigkeit ist also noch Luft nach oben.

Was wir ausgeklammert haben: Bilder

Qwen3.6 kann auch Bilder auswerten; Kolibri-1 verarbeitet ausschließlich Text. Für ein Dokumentenprodukt ist das relevant: fotografierte Lieferscheine, gescannte Verfahrensanweisungen, Belege.

Für den Vergleich haben wir diesen Aspekt bewusst ausgeklammert. Die drei gescannten Dokumente unserer Bibliothek wurden einmalig vorab von einer früheren 4-Bit-Fassung von Qwen3.6 gelesen, auf unserer eigenen Hardware, und als Text abgelegt. Beide Modelle haben anschließend auf exakt derselben Textgrundlage geantwortet. Kolibri-1 wurde also nicht dafür abgestraft, dass es keine Bilder lesen kann, und Qwen3.6 erhielt dafür keinen Bonus.

Unabhängig vom Ergebnis gilt: Für Scans und Fotos braucht es ein Vision-Modell. Manche Modelle beherrschen beides, etwa Qwen3.6 oder einige Modelle von Mistral. Mit einem reinen Textmodell wie Kolibri-1 verteilt sich die Arbeit auf zwei Modelle, eines für Bilder und eines für Text – was auf Hardware dieser Klasse problemlos möglich ist; im Test verfügte jedes Modell über ein eigenes Gerät. Die Frage dieses Vergleichs ist enger gefasst: Welches Modell liest, schlussfolgert und antwortet auf Textbasis besser?

Eine Konsequenz sei ausdrücklich genannt: Hätte das Vision-Modell einen Scan falsch gelesen, hätten beide Modelle den Fehler übernommen. Die oben beschriebene Prüfung hat bestätigt, dass jeder entscheidende Fakt das Lesen unbeschadet überstanden hat.

Wie wir für einen fairen Vergleich gesorgt haben

Aussagekräftig ist ein Modellvergleich nur, wenn alles außer dem Modell identisch ist. Unser erster Durchgang am 3. Oktober erfüllte diese Bedingung nicht: Qwen3.6 lief als komprimierte 4-Bit-Version eines Drittanbieters auf einem älteren Server-Release und mit halb so großem Kontextfenster – und Kolibri-1 lag vorn. Wir haben den Qwen-Server daraufhin nach dem Vorbild des Kolibri-Servers neu aufgesetzt und sämtliche Tests für beide Modelle wiederholt. Jedes Modellergebnis in diesem Artikel stammt aus dieser Wiederholung.

In der Wiederholung liefen beide Modelle:

  • auf demselben Gerätetyp (DGX Spark), mit demselben Inferenzserver (vLLM 0.29.0) und jeweils in der FP8-Fassung ihres Herstellers;
  • mit identischem Kontextfenster, identischen Cache-Einstellungen, demselben Speicheranteil und derselben Obergrenze für gleichzeitige Anfragen;
  • über unsere reale Antwort-Pipeline, mit denselben Prompts, demselben Suchindex, denselben Längenbegrenzungen und denselben Schutzmechanismen – ausgetauscht wurde allein das Modell.

Abweichungen haben wir nur dort zugelassen, wo das jeweilige Modell sie erfordert: beim Format der Werkzeugaufrufe, beim Schalter für den Denkmodus und bei den vom Hersteller empfohlenen Sampling-Einstellungen. Jedes Modell lief mit diesen Empfehlungen, mit der festen Einstellung unseres Chats und mit einer niedrigen Temperatur, unserem Kandidaten für die künftige Voreinstellung. Mit Denkmodus kam ausschließlich das empfohlene Sampling der Hersteller zum Einsatz: Kein Hersteller evaluiert den Denkmodus bei Temperatur 0, und unser Produkt sendet diese Kombination nicht.

Jede Frage wurde bei der festen Einstellung, bei der sich die Antworten wiederholen, einmal gestellt und bei den beiden anderen je dreimal; mit Denkmodus zweimal bei jedem Modell. Die Antworten wurden gemischt, anonymisiert und blind anhand des Lösungsschlüssels bewertet, und zwar doppelt: von zwei KI-Modellen unterschiedlicher Hersteller.

Die genauen Einstellungen samt Begründung und den Speicherbedarf auf einer DGX Spark finden Sie in den Anhängen am Ende.

Die Grenzen dieses Tests

Dies ist eine erste Kontaktaufnahme mit dem brandneuen Modell von Aleph Alpha, kein Benchmark: entstanden mit aller Sorgfalt, die wir aufbringen konnten, und am besten als zusätzlicher Datenpunkt zu verstehen. Bitte lesen Sie diesen Bericht vor dem Hintergrund folgender Einschränkungen.

  • Der Umfang ist klein. Siebzehn Fragen, ein fiktives Unternehmen, ein bis drei Durchläufe je Einstellung. Unterschiede von wenigen Hundertsteln je Antwort liegen im Rauschen. Der Unterschied mit Denkmodus beruht auf zwei Durchläufen, 68 Antworten je Modell.
  • Test und Bewertung stammen von KI. Claude Opus 5.5 hat unter unserer Anleitung und bei sehr hohem Denkaufwand die Bibliothek, den Lösungsschlüssel und die Tests verfasst. Bewertet wurde jede Antwort anschließend blind als richtig, teilweise richtig oder falsch, und zwar von zwei Prüfern: von Agenten mit Claude Opus 5.5 bei sehr hohem Denkaufwand – also demselben Modell, das den Test geschrieben hat – sowie von GPT-6.1 Sol von OpenAI bei hohem Denkaufwand, in Codex. Sie stimmten in 78 % der Bewertungen überein und stuften nie dieselbe Antwort einmal als richtig und einmal als falsch ein. Meinungsverschiedenheiten haben wir nicht aufgelöst; jedes Ergebnis ist unter beiden Prüfern ausgewiesen, und wo sie im Grad abweichen, sagen wir es: Der Vorsprung von Qwen3.6 mit der gesamten Bibliothek im Prompt hält unter beiden stand, sein kleinerer Vorsprung bei direkt vorgelegten Dokumenten liegt unter beiden im Rauschen, und der Vorsprung von Kolibri-1 mit Denkmodus liegt an der Grenze dessen, was 17 Fragen zeigen können. Die Verblindung war beim zweiten Prüfer strenger als beim ersten (Anhang D), und kein Mensch hat bislang eine Antwort bewertet; fünfzig von einer Person blind bewertete Antworten sind der nächste Schritt. Keines der getesteten Modelle stammt von einem dieser Hersteller. Der zweite Prüfer verringert das Risiko gemeinsamer blinder Flecken von Autor und Prüfer, schließt es aber nicht aus.
  • Die Pipeline ist auf Qwen eingespielt. Unsere Prompts wurden ursprünglich mit Qwen als etabliertem Modell entwickelt, was Qwen begünstigen kann.
  • Sprachen. Kolibri-1 unterstützt offiziell Deutsch und Englisch. Unsere Bibliothek enthält, wie bei einer echten Unternehmensgruppe üblich, auch spanische, polnische und chinesische Dokumente. Die Fragen wurden auf Englisch und auf Deutsch gestellt, in beiden Fällen mit englischen Anweisungen. Spanisch folgt.
  • Bilder wurden nicht verglichen. Beide Modelle haben auf derselben Textgrundlage geantwortet (siehe oben).
  • Zwei Fragen setzen Rechtswissen voraus, das nicht in der Bibliothek steht. Unser Lösungsschlüssel erwartete, dass das Modell dieses Wissen mitbringt – die 42-Stunden-Woche in Chile und die deutsche Mitbestimmung –, und beide Modelle scheiterten fast immer: Eine Frage war in allen 79 Antworten falsch, die andere in 72 von 78. Die bessere Antwort wäre wohl der Hinweis gewesen, dass die Bibliothek das Thema nicht abdeckt. Das ist ein Mangel unseres Schlüssels, nicht der Modelle; beide Fragen werden gesondert ausgewiesen.
  • Eine Frage verlangt eine Zusammenfassung, nämlich der Regeln der KI-Nutzungsrichtlinie für vertrauliche Daten. Der erste Prüfer ließ fast jede Antwort beider Modelle gelten; der zweite stufte die meisten als teilweise richtig ein, weil Nebenregeln fehlten. Zusammenfassen als eigene Aufgabe wurde nicht getestet.
  • Ein Lösungsschlüssel war falsch. Der Schlüssel zur Frage nach einer Erstbestellung vor dem Konfliktmineralien-Bericht eines Lieferanten erwartete eine Regel, die in dem zurückgehaltenen Dokument steht. Ein Modell, das antwortete, die Dokumente erwähnten sie nicht, wurde als falsch bewertet, ein entschiedenes „Nein“ als richtig – was bei dieser Frage Qwen3.6 begünstigte. Der Schlüssel muss korrigiert und die Frage neu bewertet werden; die obigen Zahlen enthalten sie. Ohne diese Frage und die beiden Fragen zu externem Recht bleibt der Gleichstand mit Suche bestehen (Kolibri-1 um 0,04 bis 0,06 je Frage vorn, im Rauschen), und der Vorsprung von Kolibri-1 mit Denkmodus fällt etwas größer aus.
  • Die Cache-Genauigkeit begünstigt, wenn überhaupt, Kolibri-1. Beide Server führen den Gesprächs-Cache in FP8 – die evaluierte Einstellung von Kolibri-1, nicht die von Qwen3.6. Kostet das Format Genauigkeit, dann die von Qwen3.6; die Einzelheiten und die Kontrolle, die wir schuldig sind, stehen in Anhang D.
  • Die Agentenszenarien stammen aus den Schwächen von Qwen. Die acht Szenarien stellen Fehler nach, die wir mit der früheren Fassung von Qwen3.6 und einem weiteren Modell gesehen hatten. Sie zielen auf bekannte Schwächen von Qwen3.6; ein Modell, das auf andere Weise scheitert, besteht sie unbemerkt.
  • Noch nicht gemessen: die reine Schreibgeschwindigkeit auf ruhigen Servern und eine Bibliothek mit bewusst entfernten Dokumenten. Beide stehen auf der Liste unten.

Unser Fazit

Vier Punkte, in der Reihenfolge, in der ein Käufer fragen würde.

  1. Es passt, und die Installation verlief reibungslos. Kolibri-1 läuft auf einer einzigen DGX Spark, vom ersten Tag an, mit dem Plugin seines Herstellers und ohne Änderung an unserem Code.
  2. Es antwortet so gut wie Qwen3.6 auf dem Pfad, den unser Produkt nutzt. Mit Suche und ohne Denkmodus liegen beide gleichauf, unter beiden Prüfern und bei jeder Sampling-Einstellung. Qwen3.6 gehört zu den meistgenutzten offenen Modellen; mit ihm gleichzuziehen ist keine Kleinigkeit. Kolibri-1 kommt mit mehr Runden und mehr Tokens je Antwort ans Ziel, dürfte also langsamer sein, und dasselbe Gerät hält ein Drittel so viele lange Gespräche. Mit Denkmodus lag es in beiden Durchläufen leicht vorn, noch nicht über den Zufall hinaus, bei einem Vielfachen der Wartezeit. In der Agentenarbeit kann sein Denkmodus eine ergebnislose Suche so lange wiederholen, bis ein Budget ihn stoppt; das ist ein Posten für das Budget, kein Urteil.
  3. Damit wird die Wahl zur Lieferkettenfrage. Ist die Qualität gleich, entscheiden andere Kriterien: Wer entwickelt das Modell, wo, unter welcher Lizenz, wie wird es gepflegt, wie beherrscht es Ihre Sprachen, und welche Kapazität kostet es je Gerät. Ein Unternehmen, das seinen KI-Lieferanten in Europa wissen will und Deutsch von Haus aus erwartet, kann mit Kolibri-1 nach diesen Kriterien wählen, ohne bei dieser Aufgabe Qualität einzubüßen.
  4. Für Bilder braucht es weiterhin ein zweites Modell – und die Hardware dafür. Kolibri-1 liest nur Text. Scans, fotografierte Lieferscheine und Belege verlangen ein Vision-Modell an seiner Seite, und auf einer DGX Spark heißt das ein zweites Gerät oder ein kleineres Modell: Ein Vision-Modell von der Größe von Qwen3.6 findet neben Kolibri-1 auf einer Spark keinen Platz.

Nach diesem ersten Blick ist das Bild vielversprechend, und Kolibri-1 gehört auf die Auswahlliste jedes Unternehmens, das seine Dokumente durch ein privates Modell laufen lässt. Den Beweis liefert die Praxis – und genau darauf freuen wir uns: Als Nächstes folgt Spanisch, dann mehr Fragen, mehr Dokumente und weitere Modelle im selben Versuchsaufbau – und natürlich der Einsatz beim Kunden.

Über die beiden Modelle hinaus gelten vier Erkenntnisse, gleich welches Modell Sie betreiben:

  1. Suchen ist günstiger, nicht genauer. Passt die Bibliothek in den Prompt, antwortete ein Modell mit allen Dokumenten vor Augen in drei von vier Konstellationen gleich gut oder besser. Für die Suche sprechen Kosten und Skalierung: bis zu zwei Drittel weniger Tokens je Frage, und sie trägt weiter, wenn die Bibliothek das Fenster längst sprengt.
  2. Abdeckung ist Teil der Antwort. Verfehlte die Suche das entscheidende Dokument, war jede der 34 Antworten eine selbstsichere Teilantwort; keine einzige lautete „Ich weiß es nicht“. Ein Assistent muss wissen und offenlegen, worauf er sich stützt – und die Suche gehört an der eigenen Bibliothek auf die Probe gestellt, bevor man ihr vertraut.
  3. Budgets statt größerer Obergrenzen. Ein Modell im Denkmodus, das nicht aufhört, zähmt man mit einer Grenze je Antwort und einer Rückfallregel, nicht mit mehr Spielraum. Das Verhalten im Fehlerfall wiegt so schwer wie die Trefferquote im Erfolgsfall.
  4. Prüfen Sie mit Ihren eigenen Dokumenten – Unstimmigkeiten eingeschlossen. Jede Dokumentenbibliothek trägt ihre eigenen Widersprüche. Auch ein Modell mit glänzenden Benchmark-Werten greift unter Umständen zum erstbesten Wert.

Wer ein Modell wählt, wählt einen Lieferanten

Leistung ist nur ein Teil der Entscheidung. Wer ein Modell auf eigener Hardware betreibt, entscheidet zugleich, auf wen er sich bei künftigen Versionen, bei Fehlerbehebungen und bei der Qualität in den eigenen Sprachen verlässt. Viele unserer Kunden handhaben das bei ihren übrigen Lieferanten längst so: Woher stammt ein Bauteil, nach welchen Regeln wird es gefertigt, gibt es eine zweite Bezugsquelle? KI-Modelle werden zu Komponenten wie alle anderen.

Inzwischen stehen ernst zu nehmende offene Modelle amerikanischer, chinesischer und französischer Hersteller zur Wahl – und mit Kolibri-1 auch das eines deutschen. Genau diese Auswahl wollen wir unseren Kunden bieten. Herkunft und Pflege gehören deshalb neben Genauigkeit, Geschwindigkeit und Kosten auf die Liste der Kriterien: Wer entwickelt das Modell, wo, und wer hält es auf dem aktuellen Stand? Für viele Unternehmen, mit denen wir sprechen, sind das keine Nebenfragen.

Offene Gewichte verringern die Abhängigkeit: Wer ein Modell unter einer Lizenz wie Apache 2.0 einsetzt, kann es dauerhaft weiter betreiben. Alles Weitere ist eine Frage der Architektur. In Iristrace Docs arbeitet das Modell hinter einem Router; es durch ein anderes zu ersetzen, wie für diesen Test, ändert das Modell und sonst nichts.

Fragen, die wir jedem Modell stellen würden:

  • Bewältigt es die Aufgabe mit Ihren Dokumenten und in Ihren Sprachen?
  • Welche Hardware setzt es voraus, und was kostet der Betrieb?
  • Unter welcher Lizenz steht es, und was genau deckt sie ab?
  • Wer entwickelt es, wo, und wie wahrscheinlich ist eine Weiterentwicklung?
  • Wie einfach ließe sich später zu einem anderen Modell wechseln?

Ausblick

Dies war ein erster Blick, und er wirft ebenso viele Fragen auf, wie er beantwortet. Die nächsten Schritte, der Reihe nach:

  • Zusammenfassen als eigene Aufgabe. Eine Richtlinie für neue Beschäftigte zusammengefasst, die Änderungen zwischen zwei Revisionen, eine polnische oder chinesische Arbeitsanweisung auf Deutsch zusammengefasst – geprüft auf erhaltene Fakten, erfundene Zahlen, Sprache und Länge.
  • Eine lückenhafte Bibliothek. Dieselben Fragen mit bewusst entfernten Schlüsseldokumenten, um zu messen, wie oft jedes Modell „Die mir vorliegenden Dokumente sagen dazu nichts“ antwortet, statt zu raten.
  • Eine Regel für Widersprüche. Wir testen eine Anweisung, die Widersprüche vor die Schlussfolgerung stellt – für beide Modelle und an neuen Fragen, damit wir nicht auf diese siebzehn hin optimieren.
  • Spanisch auf dem Prüfstand. Viele unserer Kunden arbeiten auf Spanisch. Kolibri-1 unterstützt offiziell Deutsch und Englisch; deshalb nehmen wir es als Nächstes auf Spanisch unter die Lupe – bei Fragen, Dokumenten und Antworten.
  • Ein durchgängig deutscher Aufbau. In diesem Test waren unsere Antwortanweisungen auf Englisch, auch bei deutschen Fragen – realistisch für einen Konzern, aber nicht Kolibri-1 in seiner Heimatsprache. Als Nächstes erhält es deutsche Anweisungen zu deutschen Fragen.
  • Extraktion und strukturierte Daten. Rechnungen, Lieferscheine und Scans in strukturierte Daten zu überführen, gelingt nicht ohne Vision-Modell. Fragen zu Datensätzen (Wie viele Rechnungen stammten von einem bestimmten Lieferanten, welche war die höchste?) beantworten dann strukturierte Werkzeugaufrufe auf diesen Daten, und KI-Agenten werden über einen MCP-Server direkt mit Iristrace arbeiten können. All das verlangt eigene Forschung und Messung: Fehlerszenarien, viele Wiederholungen, Läufe mit und ohne Denkmodus. Dafür reicht ein Wochenende bei Weitem nicht.
  • Weitere Modelle unter gleichen Bedingungen. Gemma 4 von Google, gpt-oss von OpenAI und Ministral von Mistral, um nur einige zu nennen – unter möglichst identischen Bedingungen betrieben, damit die Ergebnisse vergleichbar bleiben.
  • Agenten mit langer Laufzeit. Aleph Alpha positioniert Kolibri-1 auch für agentische Aufgaben. Agenten, die eine Aufgabe über viele Schritte hinweg bearbeiten – Minuten statt Sekunden –, wollen wir als Nächstes selbst erproben, beginnend mit Kolibri-1 auf einer niedrigeren Stufe des Denkmodus und mit einer harten Obergrenze für wiederholte Suchen.

Damit aus einer ersten Kontaktaufnahme eine belastbare Messung wird, muss zudem der Test selbst wachsen: mehr Fragen, einige davon von Menschen formuliert, die den Lösungsschlüssel nie gesehen haben; eine größere Bibliothek mit mehr jener Widersprüche, die echte Bibliotheken ansammeln; mehr Durchläufe; und ein Teil der Bewertungen von Menschen nachgeprüft, damit nicht allein Maschinen urteilen.

Neugier, Offenheit und Begeisterung für KI-Technologie treiben uns an.


Kolibri-1 läuft also auf einer DGX Spark – und behauptet sich dort. Applaus für Aleph Alpha und ein Dank nach Heidelberg dafür, dass private KI auf Hardware, die sich ein mittelständisches Unternehmen leisten kann, eine starke neue Option erhalten hat. Für solche Unternehmen ist das eine echte Alternative zu den amerikanischen und chinesischen Schwergewichten – ein leistungsfähiges Modell europäischer Herkunft und ein Stück Wahlfreiheit mehr.

Wenn Sie mehr erfahren oder prüfen möchten, ob eine private KI-Umgebung wie diese für Ihr Unternehmen infrage kommt, sprechen Sie uns an. Neben unseren beiden Produktlinien Iristrace Checks und Iristrace Docs bieten wir Schulungen und Beratung an. Wir freuen uns auf den Austausch mit Ihnen und darauf, gemeinsam weiterzudenken.

Zu diesem Artikel. Ein Erfahrungsbericht von Iristrace über einen zweitägigen Test mit KI, intern verfasst und ohne externe Begutachtung – kein Benchmark und keine allgemeine Rangfolge der Modelle. Mit Aleph Alpha und Alibaba verbindet uns weder eine Partnerschaft noch eine sonstige Beziehung, und für diesen Artikel haben wir keine Vergütung erhalten; mit NVIDIA verbindet uns nur, dass wir die DGX-Spark-Geräte regulär gekauft haben. Keines der drei Unternehmen hat diesen Text vor der Veröffentlichung gesehen. Die Dokumente des Tests stammen von fiktiven Unternehmen; alle Firmen- und Personennamen darin sind erfunden. KI-Modelle haben die Testbibliothek verfasst, die Antworten bewertet, die Statistik gerechnet und beim Schreiben dieses Textes geholfen; geprüft und verantwortet hat ihn Iristrace. Wir bauen und betreiben private KI-Umgebungen – mit dem Modell, das zum Kunden passt.

Anhänge, für technisch Interessierte

Anhang A – Wie die beiden Server eingerichtet waren, und warum

Beide Modelle liefen auf vLLM 0.29.0, jedes auf einer eigenen DGX Spark, hinter demselben LiteLLM-Proxy und derselben Antwort-Pipeline. Für jede Einstellung, die übereinstimmen musste, wurde vor den Durchläufen eine Begründung festgehalten.

Auf beiden Servern gleichWertBegründung
GerätNVIDIA DGX Spark: GB10 Grace Blackwell, 128 GB gemeinsamer SpeicherEin Gerät je Modell, damit die Modelle nicht um Speicher konkurrieren
InferenzservervLLM 0.29.0Die von Aleph Alphas Plugin unterstützte Version. Das Plugin ist jeweils an eine vLLM-Version gebunden; beide Server werden daher gemeinsam aktualisiert
GewichteFP8: e4m3, 128×128-Blöcke, dynamische AktivierungenJeweils die Fassung des Herstellers im selben Format, ohne Komprimierung durch Dritte
Kontextfenster262.144 TokensDas native Maximum beider Modelle; die gesamte Bibliothek in einem Prompt benötigt rund 160.000
KV-CacheFP8Von Aleph Alpha empfohlen. In voller Genauigkeit würde der Cache von Kolibri-1 nur die Hälfte fassen
GPU-Speicheranteil0,9Den Speicher der DGX Spark teilt sich die GPU mit dem Betriebssystem; diesem bleiben so rund 12 GiB
Gleichzeitige Anfragen8Das Maximum, das der Cache von Kolibri-1 beim vollen Fenster aufnimmt (9,04), abgerundet: Keine Anfrage muss auf Speicher warten. Qwen3.6 könnte mehr bewältigen, erhält aber ebenfalls 8, damit keiner der Server mehr parallel verarbeitet
Prompt-Tokens pro Verarbeitungsschritt16.384Unsere Prompts sind lang (20.000 bis 160.000 Tokens). Größere Schritte lesen sie schneller ein, zulasten eines etwas zäheren Streamings für andere Nutzer
Prefix-CachinganBeginnt ein Prompt identisch, wird dieser Teil nicht erneut gelesen. Der Anfang unserer Prompts bleibt daher unverändert; Datum und Frage stehen am Schluss
Spekulatives DecodingausIm Prinzip verlustfrei, schleust aber mehrere Tokens pro Schritt durch den Parser für gestreamte Werkzeugaufrufe, wo wir bereits Probleme beobachtet haben. Ein zusätzliches bewegliches Teil ist uns das Tempo dort nicht wert
Fragen gleichzeitig in Bearbeitung4 je ServerDie Zeiten in diesem Artikel schließen das Warten hinter anderer Arbeit ein, und der Server von Kolibri-1 trug mehr davon; Zeiten sind innerhalb eines Modells vergleichbar, nicht zwischen beiden
Bewusst verschiedenKolibri-1Qwen3.6
Parser für Werkzeugaufrufe und Denktextkolibri1qwen3_coder, qwen3
vLLM-Pluginaleph-alpha-inference von Aleph Alphakeines
Empfohlenes SamplingTemperatur 1,0, Top-p 0,97, Top-k 128Denkmodus: 1,0, 0,95, 20; sonst 0,7, 0,8, 20; Presence Penalty 1,5
Schalter für den Denkmodusreasoning_effort, betrieben auf high, der vom Hersteller evaluierten Stufeenable_thinking
Kernel-EinstellungkeineDeepGEMM aus: vLLM warnt, dass sein FP8-Skalenformat diese Architektur auf Blackwell verschlechtert

Drei Einstellungen weichen von unserem Produkt ab: Die Obergrenze für den Denkmodus lag im Test bei 32.768 Tokens je Runde, im Produkt bei 16.384. Der Test bearbeitete vier Fragen gleichzeitig je Server. Und mit Denkmodus hat der Test die Presence Penalty von 1,5 für Qwen3.6 mitgesendet, die der Denkmodus-Pfad des Produkts nicht setzt; in diesem einen Punkt weicht das Produkt von dem ab, was wir getestet haben. Ein kleines Skript liest beide laufenden Server aus und schlägt fehl, sobald eine von sieben Einstellungen abweicht: die vLLM-Version, das Gewichtsformat, das Kontextfenster, die Cache-Genauigkeit, der Speicheranteil, das Prefix-Caching und das spekulative Decoding. Drei weitere Einstellungen sind von außen nicht sichtbar: die Zahl der gleichzeitig bearbeiteten Anfragen, die Prompt-Tokens pro Verarbeitungsschritt und die Kernel, die jeder Server gewählt hat. Diese haben wir in den Startprotokollen beider Server geprüft, die zudem dasselbe Gerät ausweisen.

Anhang B – Was in eine DGX Spark passt

Die Modellkarte sagt wörtlich: „Model memory footprint: ~78 GB (FP8 weights). Minimum: 2× A100 80 GB, 2× H100 SXM5, 1× H200, 1× B200 or 1× B300. Recommended: 2× H100 SXM5, 2× H200, 1× B200 or 1× B300.“ Eine DGX Spark verfügt über 128 GB Speicher, den sich Prozessor und Grafikeinheit teilen. Die rund 78 GB der Modellkarte und die 73,6 GiB in der folgenden Tabelle sind dieselbe Menge in verschiedenen Einheiten. So fand Kolibri-1 darin Platz, laut seinem letzten Startprotokoll:

Kolibri-1 auf einer DGX SparkGiB
Beim Start sichtbarer Speicher121,7
Anteil von vLLM (0,9)rund 109,5
Modellgewichte im Speicher, FP873,6
KV-Cache, FP8: 2.370.457 Tokens, 9,04 Gespräche beim vollen Fenster34,1
Arbeitsspeicher für die Berechnung selbstrund 2
Verbleibend für das Betriebssystem und alles Übrigerund 12
Im VergleichKolibri-1Qwen3.6
Parameter, gesamt / aktiv pro Token78,1 Milliarden / 3,46 Milliarden35 Milliarden / 3 Milliarden
Gewichte im Speicher, FP873,6 GiB34,2 GiB
KV-Cache2.370.457 Tokens7.014.337 Tokens
Gespräche beim vollen Fenster von 262.144 Tokens9,0426,76
Vom Start bis zur ersten Antwort11 Minutenrund 8 Minuten

Warum hält Qwen3.6 dreimal so viel Gesprächskontext? Nicht, weil sein Cache in weniger Schichten wächst: Beide Modelle führen nur in 10 Schichten einen Cache, der mit jedem Token zunimmt (Kolibri-1 in 10 von 50, die übrigen 40 blicken 513 Tokens zurück; Qwen3.6 in 10 von 40, die übrigen 30 nutzen lineare Attention). Der Unterschied ist vor allem eine Frage des Platzes: Die Gewichte von Qwen3.6 belegen halb so viel Speicher, was doppelt so viel Raum für den Cache lässt. Der Rest ergibt sich daraus, wie der Server den jeweiligen Cache anlegt, was wir nicht analysiert haben.

Beide Server lesen ihre Gewichte ohne Vorauslesen von der Festplatte, mit rund 120 bis 145 MB/s. Die 74 GiB von Kolibri-1 beanspruchen rund neun seiner elf Minuten, die 34 GiB von Qwen3.6 fünf. Ein Neustart des Modellservers will in der Praxis also geplant sein.

Eine Frage ist noch offen: Vor seinem letzten Neustart meldete der Server von Kolibri-1 bei gleichem Speicheranteil einen Cache von 3,38 Millionen Tokens, danach von 2,37 Millionen. Die Arithmetik grenzt es ein: Der endgültige Cache kostet rund 15,4 KB je Token (34,1 GiB für 2,37 Millionen Tokens), und zu diesem Satz bräuchten 3,38 Millionen Tokens 48,6 GiB – mehr als die rund 36 GiB, die neben den Gewichten frei waren. Der frühere Server muss seinen Cache also zu geringeren Kosten je Token angelegt haben. Die Kapazität ist nicht verschwunden; die Buchführung hat sich mit dem Neustart geändert, und welche Einstellung sie geändert hat, haben wir noch nicht bestimmt.

Anhang C – Die gesamte Bibliothek in einem Prompt

Beide Modelle verarbeiten nativ bis zu 262.144 Tokens. Unsere gesamte Bibliothek umfasst rund 160.000 und passt damit mit Reserve in einen einzigen Prompt. Beide Modellkarten beschreiben längere Fenster von rund einer Million Tokens: Laut Karte hat Aleph Alpha die Qualität von Kolibri-1 bis 1.048.576 Tokens validiert, Qwen3.6 erreicht sie per YaRN-Skalierung. Diese haben wir nicht getestet; beide Modelle liefen mit ihrem nativen Fenster, und dessen Rand haben wir ausgelotet.

Der Rand des Fensters, auf ruhigen Servern. Drei kurze Werte werden am Anfang, in der Mitte und am Ende eines Archivs nummerierter Datensätze versteckt, und das Modell soll alle drei nennen. Jeder Prompt beginnt mit einer neuen Zufallszeile, damit der Server nichts bereits Gelesenes wiederverwenden kann; die Zeiten sind kalt, ohne Denkmodus, bei Temperatur 0. Es war der eine Test, bei dem sonst nichts auf den Servern lief; seine Zeiten sind deshalb zwischen den beiden vergleichbar.

Prompt-TokensKolibri-1: Sekunden, alle drei gefundenQwen3.6: Sekunden, alle drei gefunden
rund 64.00015 bis 16, in 4 von 4 Versuchen17, in 3 von 4 Versuchen
rund 129.00045, ja46, ja
rund 196.00087, ja89, ja
rund 247.000130, ja131, ja
rund 260.000145, ja146, ja
266.144, über dem Fensterabgelehnt, mit sauberer Fehlermeldungabgelehnt, mit sauberer Fehlermeldung

Beide finden alle drei Werte bis an den Rand des Fensters. Der einzige Fehlgriff war der erste Versuch von Qwen3.6 bei 64.000 Tokens, der drei Datensatznummern statt der versteckten Werte lieferte; drei Wiederholungen in dieser Größe waren richtig. Beide lesen einen langen Prompt gleich schnell, bei jeder Größe binnen rund zwei Sekunden voneinander: 3.700 bis 4.200 Tokens je Sekunde bei 64.000 und rund 1.800 bei 260.000 – das ganze Fenster einmal zu lesen, dauert also rund zweieinhalb Minuten. Über dem Fenster lehnen beide sauber ab, mit einer Fehlermeldung, die den Grund nennt und die unser Gateway in einen Hinweis an den Benutzer übersetzt. Der Test ist eng gefasst, drei exakte Zeichenketten in gleichförmigem Fülltext: Er sagt, dass das volle Fenster funktioniert und was das Lesen kostet, nicht, wie gut ein Modell über eine lange, vielfältige Dokumentensammlung schlussfolgert. Das misst die Bedingung mit der gesamten Bibliothek.

Beobachtet haben wir, über rund 370 Prompts mit der gesamten Bibliothek von 145.000 bis 159.000 Tokens:

  • Das erste Lesen kostet eine Minute. 62 bis 68 Sekunden bis zum ersten Token auf beiden Servern, wenn eine Bibliothek zum ersten Mal gelesen wird.
  • Das zweite Lesen ist das günstige. Beginnt ein langer Prompt genauso wie ein früherer, greift der Server auf das bereits Gelesene zurück und liest nur den Rest. Nach dem ersten Lesen begannen die Antworten binnen zwei bis vier Sekunden. Deshalb stehen in unseren Prompts die Dokumente vorn, Datum und Frage hinten – und deshalb kommt es darauf an, dass die Chat-Vorlage eines Modells nichts einfügt, was sich von Anfrage zu Anfrage ändert.
  • Lange Prompts sind der Ort der Wiederholungen. Bei der festen Einstellung ohne Denkmodus begannen sechs von 68 Antworten mit der gesamten Bibliothek, sich zu wiederholen, oder liefen in die Ausgabegrenze – häufiger als unter jeder anderen Bedingung. Unsere Wiederholungssperre und die Ausgabegrenze haben sie aufgefangen. Mit den Sampling-Empfehlungen der Hersteller trat das fast nie auf.
Anhang D – Entscheidungen, die hinterfragt werden können, und unsere Gründe

Wer Modelle beruflich betreibt, fragt nach den Einstellungen, bevor er die Ergebnisse liest. Dies sind die Fragen, die wir uns selbst stellen würden – mit der Antwort und, wo wir eine schuldig sind, mit der Kontrolle, die noch aussteht.

Warum diese beiden Modelle? Nahezu gleich viele aktive Parameter, 3,46 und 3 Milliarden je Token, stellen sie auf derselben Hardware in dieselbe Geschwindigkeitsklasse. Beide passen in FP8 auf eine DGX Spark, beide stehen unter Apache 2.0, beide bieten Denkmodus und Werkzeugaufrufe bei einem Fenster von 262.144 Tokens. Sie unterscheiden sich dort, wo ein Käufer den Preis des Unterschieds kennen will: Kolibri-1 hat mehr als doppelt so viele Parameter insgesamt und den entsprechenden Speicherbedarf; Qwen3.6 deckt mehr Sprachen ab und liest Bilder.

Warum FP8, und warum jeweils die Fassung des Herstellers? Volle Genauigkeit passt nicht: Die bfloat16-Gewichte von Kolibri-1 benötigen rund 156 GB. Die 4-Bit-Fassung von Qwen3.6 eines Drittanbieters, die zuvor getestet wurde, erreicht nach der Auswertung ihres eigenen Herstellers bei mehrstufigen Werkzeugaufrufen 93 % der vollen Genauigkeit – deshalb war unser erster Durchgang unfair. Die FP8-Fassung des jeweiligen Herstellers ist die höchste Genauigkeit, mit der beide hier laufen können. Eine Asymmetrie bleibt: Die letzte Trainingsphase von Kolibri-1 war quantisierungsbewusst, die FP8-Fassung von Qwen3.6 wurde nach dem Training erzeugt. Laut Modellkarte ist Qwens FP8 „nahezu identisch“ mit dem Original; selbst gemessen haben wir das nicht.

Warum ein FP8-Gesprächs-Cache auf beiden Servern? Weil Aleph Alpha Kolibri-1 so betreibt und evaluiert, und weil der Cache von Kolibri-1 in voller Genauigkeit nur halb so viel fassen würde. Der Hersteller von Qwen3.6 dokumentiert diese Einstellung nicht, und der Server warnt bei beiden vor unkalibrierten Skalen. Kostet das Format Genauigkeit, trifft es Qwen3.6 stärker als Kolibri-1. Der Einfluss ist begrenzt, 10 von 40 Schichten bei Qwen3.6 gegenüber allen 50 bei Kolibri-1, und ein Cache in voller Genauigkeit wäre für den Test allein machbar gewesen: Kolibri-1 hätte die vier gleichzeitigen Prompts mit der gesamten Bibliothek weiterhin gefasst. Die Kontrolle, die wir als Erstes nachholen, ist Qwen3.6 mit Cache in voller Genauigkeit, mit Suche und ohne Denkmodus, rund hundert Antworten.

Warum Denkmodus auf high? Es ist die Stufe, die Aleph Alpha evaluiert und veröffentlicht, und der Denkmodus von Qwen3.6 kennt keine Stufen. Jedes Modell in der vom Hersteller evaluierten Konfiguration zu vergleichen, ist die vertretbare Wahl – und sie bedeutet, dass die fünf Minuten je Antwort der teuerste Modus von Kolibri-1 sind. In den Agentenszenarien halbierte medium die ausbleibenden Antworten; bei den Fragen ist es noch nicht gelaufen. Das ist die zweite Kontrolle, die wir schuldig sind.

Warum drei Sampling-Einstellungen ohne Denkmodus und nur eine mit? Temperatur 0 sendet unser Produkt; die Empfehlungen der Hersteller sind das, was sie evaluieren; 0,3 mit Top-p 0,9 ist unser Kandidat für die Voreinstellung, an beide gesendet. Die Modellkarte von Kolibri-1 nennt eine einzige Einstellung, Temperatur 1,0, ohne gesonderte Angabe für den Betrieb ohne Denkmodus; seine „empfohlene“ Zelle läuft also in einem Modus, für den der Hersteller keine Werte veröffentlicht hat. Qwens 0,7 ist dokumentiert, und seine Modellkarte merkt an, dass die Presence Penalty von 1,5, die wir verwendet haben, gelegentlich zu Sprachmischung und einer leicht geringeren Leistung führen könne. Zwei ehrliche Fußnoten. Erstens benennt eine Anfrage nur einen Teil der Parameter; die übrigen fallen auf die Voreinstellungen des jeweiligen Servers zurück – das Top-k des Herstellers und bei Qwen3.6 die auf seinem Proxy-Alias gesetzte Presence Penalty. Bei Temperatur 0 und bei 0,3 waren die beiden Modelle also gleich in dem, was wir gesetzt haben, und verschieden in dem, was wir nicht gesetzt haben; Qwens Temperatur 0 war kein reines Greedy Decoding. Zweitens haben wir noch nicht Ende zu Ende geprüft, dass jeder Parameter den Proxy passiert; eine zehnminütige Probe ist geplant. Keine der beiden Fußnoten berührt den Gleichstand mit Suche, der bei allen drei Einstellungen gilt, die der Hersteller eingeschlossen. Mit Denkmodus lief ausschließlich das Sampling der Hersteller: Keiner empfiehlt Greedy Decoding für den Denkmodus, beide veröffentlichen stattdessen Sampling-Einstellungen, und unser Produkt sendet diese Kombination nie. Das Testskript hat sie dennoch durchlaufen; das Ergebnis steht oben als Hinweis für den Betrieb.

Warum ein Durchlauf bei Temperatur 0 und drei bei den anderen? Temperatur 0 wiederholt sich nahezu wörtlich; drei Durchläufe wären eine kopierte Stichprobe. Bei gesampelten Einstellungen ist jeder Durchlauf eine neue Ziehung – dort gehören die Wiederholungen hin.

Warum eine Obergrenze von 32.768 Tokens für den Denkmodus, wenn das Produkt 16.384 erlaubt? Die Modellkarte von Qwen3.6 empfiehlt 32.768 „für die meisten Anfragen“, und bei 16.384 war Kolibri-1 in unserem ersten Durchgang bei zwei Fragen mitten im Nachdenken an die Grenze gestoßen. Jede Antwort protokolliert ihre Tokens; die Daten sagen also auch, was 16.384 abgeschnitten hätte: 13 der ersten 114 Antworten mit Denkmodus von Kolibri-1.

Warum vier Fragen gleichzeitig – und warum kein Urteil zur Geschwindigkeit? Um in der verfügbaren Zeit fertig zu werden. Beide Server fassen acht; beide bearbeiteten vier Fragen zugleich, und beide trugen daneben die Agentenszenarien und die Wiederholungsläufe – der Server von Kolibri-1 mehr und länger: Seine Fragedurchläufe überschnitten sich den ganzen Abend mit anderer Arbeit, während der zweite Durchlauf mit Denkmodus von Qwen3.6 allein lief. Qwens eigene Antworten mit Denkmodus waren im belasteten Durchlauf 15 % langsamer als im ruhigen, und die Mediane von Kolibri-1 ohne Denkmodus reichten je nach Durchlauf von 38 bis 91 Sekunden. Sekunden je Antwort sind deshalb innerhalb eines Modells vergleichbar, nicht zwischen beiden, und der Artikel behauptet zur Geschwindigkeit nur, was sich nicht durch Last erklären lässt: mehr Runden und mehr Tokens je Antwort bei Kolibri-1. Die Geschwindigkeit bei einzelnen Anfragen auf ruhigen Servern ist eine eigene Messung, die noch aussteht.

Warum unsere eigene Pipeline statt eines neutralen Testaufbaus? Weil die Frage lautet, wie sich jedes Modell in unserem Produkt bewährt. Der Nachteil ist benannt: Der Antwort-Prompt wurde verfeinert, als Qwen3.6 noch das Modell dahinter war; er könnte Qwen3.6 daher entgegenkommen.

Warum drei Arten, die Belege bereitzustellen? Um Finden und Lesen zu trennen. Mit Suche kann eine falsche Antwort am Retriever liegen. Mit nur den richtigen Dokumenten im Prompt liegt sie am Modell. Mit der gesamten Bibliothek liegt sie wieder am Modell – unter der Last von 160.000 Tokens.

Wie der Vergleich berechnet wird. Antworten auf dieselbe Frage sind nicht unabhängig: Eine schwere Frage ist überall schwer. Deshalb wird der Wert jedes Modells zuerst je Frage gemittelt, und die 17 Fragen werden paarweise verglichen. Der mittlere Unterschied je Frage, Qwen3.6 minus Kolibri-1, mit einem 95-%-Bootstrap-Intervall über die Fragen:

EinstellungErster PrüferZweiter Prüfer
Mit Suche, ohne Denkmodus, alle drei Samplings+0,00 (−0,12 bis +0,12)−0,03 (−0,15 bis +0,08)
Mit Suche, ohne Denkmodus, Temperatur 0,3+0,01 (−0,14 bis +0,14)−0,03 (−0,16 bis +0,09)
Mit Suche, mit Denkmodus−0,07 (−0,15 bis −0,02)−0,08 (−0,17 bis +0,00)
Gesamte Bibliothek im Prompt, ohne Denkmodus+0,16 (+0,08 bis +0,24)+0,11 (+0,03 bis +0,19)
Nur die richtigen Dokumente, ohne Denkmodus+0,07 (−0,02 bis +0,17)+0,04 (−0,06 bis +0,14)

Schlicht gelesen schließt der Vorsprung von Qwen3.6 mit der gesamten Bibliothek die Null unter beiden Prüfern aus, und der Vorsprung von Kolibri-1 mit Denkmodus endet nach dem zweiten Prüfer bei null und schließt die Null nach dem ersten nur knapp aus; ein Rangtest über die 17 Fragen findet ihn unter keinem der beiden signifikant. Streng gelesen haben wir mindestens acht solcher Vergleiche angestellt, sodass ein Leser die Intervalle entsprechend weiten sollte, auf rund 99,4 % statt 95 %; nach diesem Maßstab schließt nur noch der Unterschied mit der gesamten Bibliothek nach dem ersten Prüfer die Null aus, und alles Übrige – der Vorsprung mit Denkmodus von Kolibri-1 eingeschlossen – ist eine Richtung, die die nächsten Durchläufe bestätigen müssen. Ohne die beiden Fragen zu externem Recht und die Frage mit dem falschen Schlüssel verschieben sich die Werte leicht zugunsten von Kolibri-1; am Bild ändert das nichts. Der Gleichstand mit Suche ist unter beiden Prüfern ein Gleichstand. Würde man die 1.428 Antworten als unabhängig behandeln, schrumpfte jedes Intervall, und die Belege erschienen stärker, als sie sind; das unterlassen wir.

Frage für Frage. Die Abstände bei zwei Fragen wirkten zu groß für einen Zufall. Um das zu prüfen, haben wir Claude Opus 5.5 in Claude Code gebeten, jede Frage zu testen, nicht nur die auffälligen. Es verglich die 14 Antworten je Modell und Frage, mit Suche und ohne Denkmodus, in einem exakten Permutationstest: Machte das Modell keinen Unterschied, wäre sein Name ein beliebiges Etikett; der Test zählt deshalb über alle Möglichkeiten, die 28 Antworten in zwei Gruppen zu je 14 aufzuteilen, wie oft ein so großer Abstand wie der tatsächliche entsteht. Er setzt nichts über die Verteilung der Punkte voraus – wichtig bei drei möglichen Bewertungen und 14 Antworten je Seite. Wer siebzehn Fragen auf einmal prüft, muss korrigieren: Beim üblichen 5-%-Niveau läge die Wahrscheinlichkeit, dass mindestens eine Frage allein durch Zufall signifikant erscheint, bei rund 58 %. Korrigiert wurde nach Holm. Das Verfahren hält die Wahrscheinlichkeit auch nur einer falschen Aussage über alle siebzehn Fragen bei 5 %, gilt unabhängig davon, wie die Fragen voneinander abhängen – sie teilen Modelle, Durchläufe und Bibliothek –, und findet nie weniger als die einfachere Bonferroni-Korrektur. Unter beiden Prüfern bleiben zwei Unterschiede bestehen, jeweils mit einem korrigierten p unter 0,01: Frage 5, die 90-Tage-Regel des Kunden (0,86 gegen 0,14), und Frage 8, das nicht mehr freigegebene Schmierfett (0,61 gegen 1,00). Frage 17, die mit dem falschen Schlüssel, besteht nur nach dem ersten Prüfer (rund 0,01; nach dem zweiten 0,07). Bonferroni ergibt dieselben drei. Das Skript ist zusammen mit dem Datensatz aufbewahrt.

Reichen die Stichproben? Für das, was wir behaupten, ja; für mehr nicht. Ein Test mit Korrektur hält Fehlalarme bei jeder Stichprobengröße bei 5 %; eine kleine Stichprobe verbirgt nur kleinere Unterschiede. Nach der Korrektur zeigen 14 Antworten je Seite verlässlich Abstände von etwa 0,4 bis 0,65 Punkten je Antwort; eine Frage ohne signifikanten Unterschied kann sich also trotzdem unterscheiden (die Tagespauschale, mit 0,21, ist ein Kandidat). Jeder Befund beruht zudem auf einer einzigen Frage: Ihre 14 Antworten wiederholen sie über Durchläufe und Sprachen hinweg. Sie zeigen, dass ein Verhalten bei dieser Frage stabil ist, nicht, dass es für jede Frage dieser Art gilt; und weil sie nicht völlig unabhängig sind, fallen die p-Werte eher zu günstig aus – die beiden Unterschiede sind groß genug, dass das an der Lesart nichts ändert. Schließlich ist der Gleichstand insgesamt ein Gleichstand innerhalb von etwa ±0,12 je Antwort: Um Modelle zu unterscheiden, die 0,10 auseinanderliegen, braucht es rund fünfzig Fragen, bei 0,05 rund zweihundert.

Warum KI-Prüfer, und warum zwei? 1.428 Antworten in der verfügbaren Zeit lassen keine andere Wahl, und ein vorab festgelegter Bewertungsmaßstab, blinde Bewertung und ein zweiter Prüfer eines anderen Herstellers sind die bekannten Gegenmaßnahmen. Ihre Übereinstimmung, 78 % bei einem Cohens Kappa von 0,68, gilt nach der üblichen Skala als substanziell, und die Abweichungen gehen in eine Richtung: Der zweite Prüfer liest die Nebenangaben der Lösungsschlüssel als Pflicht. Diese Unschärfe liegt in unserem Maßstab, nicht bei den Prüfern, und sie trifft beide Modelle gleichermaßen. Die Verblindung war beim zweiten Prüfer strenger als beim ersten: Der zweite arbeitete in einem Ordner, der nichts als den Bewertungsmaßstab, die Fragen und die Antworten unter neuen Schlüsseln enthielt; die Agenten des ersten Prüfers waren angewiesen, den Lösungsschlüssel nicht zu öffnen, der im selben Ordnerbaum lag, und das verirrte Tag von Qwen3.6 blieb in zehn der verblindeten Antworten als Fingerabdruck erhalten. In der nächsten Runde wandert der Schlüssel außer Reichweite, und das Tag wird mit der Formatierung entfernt. Der nächste Schritt ist ein Mensch, der eine Stichprobe der Bewertungen liest – der eine Schritt, den keine zweite Maschine ersetzt.

Was würde uns zu einer Wiederholung zwingen statt zu einer Ergänzung? Nichts von dem, was wir gefunden haben. Die genannten Kontrollen ergänzen Zellen; keine entwertet eine. Zu einer Wiederholung zwänge ein Einstellungsfehler, der nur ein Modell betrifft – und das Prüfskript sowie beide Startprotokolle sind aufbewahrt, damit ein unabhängiger Gutachter danach suchen kann.

Anhang E – Die Daten: Frage für Frage, Szenario für Szenario, Kosten je Antwort

Die 17 Fragen. Punkte je Antwort im Mittel, mit Suche und ohne Denkmodus, richtig 1, teilweise ½, falsch 0, über 14 Antworten je Modell und Frage (sieben Durchläufe, Englisch und Deutsch); erster Prüfer, zweiter Prüfer in Klammern. Die letzte Spalte zählt die Suchen, von 36 je Frage, die jedes im Lösungsschlüssel genannte Dokument geliefert haben.

Frage, und worin die Schwierigkeit liegtKolibri-1Qwen3.6Schlüsseldokumente gefunden
1. Wer darf einen Investitionsantrag über 120.000 € im Werk Tychy genehmigen?
Richtlinie und Freigabematrix nennen unterschiedliche Grenzen; Euro gegen Złoty
0,61 (0,68)0,54 (0,64)34 von 36
2. Wie hoch ist die aktuelle Obergrenze für Hotelkosten auf Geschäftsreisen?
Zwei Revisionen, die alte noch als „Effective“ markiert
0,89 (0,50)1,00 (0,50)36 von 36
3. Bei welchen Dokumenten ist die Überprüfung überfällig?
Verlangt die Durchsicht aller Dokumente; das entscheidende ist ein Scan
0,00 (0,00)0,00 (0,00)8 von 36
4. Welcher Härtebereich gilt in Changzhou, und stimmt er mit der Konzernspezifikation überein?
Werksanweisung weicht ohne Abweichungsgenehmigung von der Konzernspezifikation ab
0,86 (0,86)0,79 (0,57)36 von 36
5. Mit welcher Vorlaufzeit müssen wir HallvikDemo Trucks vor einer Produktänderung informieren?
Kundenmatrix (90 Tage) strenger als die Änderungsprozedur (60)
0,86 (0,89)0,14 (0,18)26 von 36
6. Sind unsere Personaldokumente für Chile auf dem Stand des Arbeitszeitrechts?
Setzt das chilenische Gesetz von 2026 voraus; nicht in der Bibliothek
0,00 (0,00)0,00 (0,00)18 von 36
7. Stimmt die USMCA-Ursprungsanalyse damit überein, wo die Ringe gefertigt werden?
Ursprungstabelle sagt Nordamerika; Lenkungsplan bezieht die Ringe aus China
0,82 (0,79)1,00 (1,00)36 von 36
8. Welche Fettsorte kaufen wir laut Vertrag bei ChemcoDemo, und ist es die freigegebene?
Der Vertrag nennt eine Fettsorte, die laut Spezifikation nicht mehr freigegeben ist
0,61 (0,61)1,00 (1,00)36 von 36
9. Gilt die Homeoffice-Richtlinie in Schweinfurt so, wie sie geschrieben ist?
Setzt deutsche Mitbestimmung voraus; nicht in der Bibliothek
0,00 (0,04)0,07 (0,11)36 von 36
10. Nenne alle Dokumente, die auf ein nicht existierendes Dokument verweisen.
Verlangt die Durchsicht aller Dokumente
0,00 (0,00)0,04 (0,04)33 von 36
11. Fasse die Regeln der KI-Nutzungsrichtlinie für vertrauliche Daten zusammen.
Eine Zusammenfassung; der zweite Prüfer verlangte jede Nebenregel
1,00 (0,54)1,00 (0,57)36 von 36
12. Darf ein Ingenieur der Stufe Grade C die volle Tagespauschale für Mexiko ohne Genehmigung ausschöpfen?
Die Pauschale übersteigt die Grenze der Freigabematrix für Grade C
0,96 (0,96)0,75 (0,79)36 von 36
13. Wie lange müssen wir Rückverfolgbarkeitsaufzeichnungen für Teile von SolanoDemo Automotive aufbewahren?
Der Kunde verlangt 20 Jahre, die Prozedur sagt 15; die Matrix wurde meist nicht gefunden
0,25 (0,25)0,00 (0,00)9 von 36
14. Darf ich von einem Lieferanten ein Geschenk im Wert von 75 € annehmen?
Einkaufsrichtlinie (50 €) gegen Konzernkodex (100 €)
0,75 (0,79)0,79 (0,75)32 von 36
15. Welche Funktionsbezeichnung hat Iker Olaizola Mendia?
Zwei Titel in zwei Dokumenten; die 8D-Prozedur wurde nie gefunden
0,50 (0,50)0,50 (0,50)0 von 36
16. Was passiert, wenn ein Lieferant seinen Bericht zu Konfliktmineralien nicht zurückschickt?
Das zurückgehaltene Dokument; richtig ist „nicht abgedeckt“
0,93 (0,89)1,00 (0,86)—
17. Dürfen wir bei einem neuen Lieferanten eine Erstbestellung aufgeben, bevor er sein CMRT schickt?
Der Schlüssel belohnt das zurückgehaltene Dokument; wird korrigiert
0,25 (0,18)0,75 (0,46)—

Mit Denkmodus liegen vier Antworten je Modell und Frage vor (zwei Durchläufe, zwei Sprachen): Kolibri-1 erzielt bei sechs Fragen den höheren Wert (1, 2, 4, 5, 8 und 13), Qwen3.6 bei einer (10), die übrigen enden unentschieden. Die Mittelwerte je Frage stehen in unserem Datensatz.

Die Agentenszenarien. Bestandene Durchläufe von 10 je Zelle, fünf auf Englisch und fünf auf Deutsch, mit dem empfohlenen Sampling des jeweiligen Herstellers, Kolibri-1 mit Denkmodus auf high. Die Szenarien 1 und 2 gibt es nur mit Denkmodus.

Szenario, und wann es bestehtKolibri-1 ohneQwen3.6 ohneKolibri-1 mitQwen3.6 mit
S1 Ein Werkzeugaufruf im Denkmodus
der Aufruf strukturiert ist, nicht Text
——1010
S2 Dasselbe, mit Aufrufpflicht
der Aufruf dennoch erfolgt
——1010
S3 Zwanzig Tickets, alle mit einem Datum
das Datum durchgängig richtig genannt wird
104910
S4 Eine Liste von Rechnungen
die höchste genannt wird, und nur sie
1010109
S5 Ein Maximum ohne seine Kennung
die Kennung nachgeschlagen oder das Fehlen benannt wird; nie erfunden
1091010
S6 Eine Suche ohne Treffer
es das sagt und nichts erfindet
9959
S7 Ein Werkzeug mit ständigen Zeitüberschreitungen
es aufhört und antwortet
810210
S8 Eine Liste mit 25 Einträgen
kein Ausufern, keine Wiederholung
10677

Zwei Zellen brauchen eine Fußnote. Die sechs Ausfälle von Qwen3.6 in S3 ohne Denkmodus gingen nicht auf das Modell zurück: Auf Deutsch gefragt, nutzte es unser nachgebildetes Aggregationswerkzeug, das für Tickets „keine Daten“ liefert, und gab genau das wieder – eine Lücke in unserem Testwerkzeug. S8 ist als Test fehlerhaft: Es wertet die Verweigerung der langen Liste als Ausfall, was ein Ausfall anderer Art ist. Die Prüfungen sind Musterabgleiche auf Formulierungen in zwei Sprachen und wurden während der Durchläufe korrigiert; jeder Durchlauf behält sein ursprüngliches Urteil neben dem korrigierten.

Kosten und Ausreißer je Antwort. Tokens, Runden und Aufrufe sind Mittelwerte über die Antworten mit Suche. Prompt-Tokens sind über die Runden einer Antwort summiert: Jede Runde sendet die Anweisungen, die Werkzeugdefinitionen und alles bisher Gefundene erneut, eine Antwort mit fünf Runden liest ihren Kontext also fünfmal. Die Mittelwerte ziehen die Antworten nach oben, die das Rundenbudget erreichten; eine typische Antwort braucht vier Runden bei Kolibri-1 und zwei bei Qwen3.6. Die Sekunden gelten über alle Antworten jeder Belegart und wurden unter unserer Testlast gemessen, die auf dem Server von Kolibri-1 höher war; vergleichen Sie sie innerhalb eines Modells.

Je AntwortKolibri-1 ohneKolibri-1 mit (high)Qwen3.6 ohneQwen3.6 mit
Gelesene Prompt-Tokens, über alle Runden einer Antwort summiert, mit Sucherund 86.000rund 75.000rund 53.000rund 61.000
Ausgabe-Tokens, mit Suche, Denktext eingeschlossenrund 710rund 6.900rund 780rund 2.900
Modellrunden / Werkzeugaufrufe, mit Suche, Mittelwert5,0 / 6,04,3 / 6,54,0 / 3,04,5 / 3,9
Sekunden, Median / 90. Perzentil / langsamste, unter Testlast31 / 114 / 508292 / 1.162 / 2.89422 / 70 / 408120 / 264 / 2.119
Antworten über zehn Minuten0 von 51047 von 2040 von 5106 von 204
Ausgabe-Tokens, Median / 90. Perzentil / Maximum369 / 975 / 7.2844.393 / 17.037 / 48.493355 / 927 / 5.2932.839 / 5.506 / 32.768

Jede Zeile dieser Tabellen ist eine Zeile unseres Datensatzes: ein Eintrag je Antwort mit beiden Bewertungen und einer je Agentendurchlauf mit seinem Urteil.

Cookie-Einstellungen

Wählen Sie, welche Cookies Sie akzeptieren. Sie können das jederzeit über „Cookie-Einstellungen“ am Ende jeder Seite ändern. Cookie-Richtlinie