Prüfstand
So prüfen und verbessern wir Bauly.
Bauly wird mit einem festen Katalog von Baufragen geprüft. Ein zweites KI-Modell bewertet jede Antwort gegen eine vorab hinterlegte Prüfzeile – eine automatisierte Eigenprüfung, kein unabhängiges Audit. Wir veröffentlichen die Ergebnisse, untersuchen Fehler und zeigen, welche Änderungen wir übernehmen und welche nicht.
Im Einsatz
Gemini 3.5 Flash-Lite
seit 11. September 2026, vorher Gemini 2.5 Flash. Umgestellt als Ergebnis des Modellvergleichs. Die drei Modelle hinter den Nebenfunktionen wurden am 11./12. September einzeln geprüft und umgestellt: Gegenprobe der Quellenangaben auf Gemini 3.1 Flash-Lite, vertiefte Zweitprüfung auf Gemini 3.5 Flash, Folgefragen und Gesprächstitel auf Gemini 3.5 Flash-Lite.
Letzter Vergleich
10.–11. September 2026, 176 Fragen
Vier Sprachmodelle und eine neue Regel für den Antwortaufbau, jeweils mit denselben Fragen und denselben Quellen.
Messverfahren
überarbeitet im September 2026
Wir haben sieben Fehler im eigenen Prüfverfahren gefunden und behoben. Ergebnisse von vor dieser Überarbeitung sind mit späteren nur eingeschränkt vergleichbar.
Wie wir prüfen
4'879 bewertete Antworten
In 31 Messläufen seit dem Ausgangsstand, jede Antwort einzeln vom Richter beurteilt – darunter 295 Vergleiche mit dem Deep-Check-Modell. Verworfene Experimente zählen mit, denn auch sie wurden vollständig gemessen.
176 Prüffragen
135 Fachfragen aus vier Wissensbereichen zu 27 Themen – je drei, wie sie im Alltag gestellt werden, und zwei schwierige mit Fristen, Werten und Normbezug – dazu 41 Zusatzfälle für Rechenaufgaben, Manipulationsversuche, Themen ausserhalb des Bauens und die Übergabe an Fachpersonen.
Eine Prüfzeile pro Frage
Jede Frage trägt vorab den erwarteten Kern der Antwort: die Frist, den Wert, die Norm oder die Kernaussage, an der sich entscheidet, ob die Antwort trägt. Die Prüffragen sind redaktionell erstellt; wir übernehmen keine Fragen aus Nutzergesprächen.
Ein zweites Modell als Richter
Ein leistungsfähigeres KI-Modell, das an der Antwort nicht beteiligt war, bewertet jede Antwort gegen die Prüfzeile und liest die zitierten Quellen mit. Es vergibt drei Stufen: vollständig richtig, teilweise richtig, falsch.
Die Zahlen
Messung vom 11. September 2026, Version 58
Erhoben auf Gemini 3.5 Flash-Lite, dem Modell, mit dem Bauly seit 11. September 2026 antwortet. Diese Zahlen stammen erstmals vom heute eingesetzten Modell und aus dem überarbeiteten Prüfverfahren. Mit dem Stand vom 3. September sind sie deshalb nur eingeschränkt vergleichbar: Der Korrektheitsscore fällt allein durch das strengere Prüfverfahren um rund zwei Punkte tiefer aus, und die Zahl der Prüffragen ist von 165 auf 176 gewachsen.
Fachliche Korrektheit
84.1von 100
+11.9 seit Ausgangsstand
135 Fachfragen · vollständig richtig zählt 2 Punkte, teilweise 1, falsch 0
Antworten mit fachlichen Fehlern
3 %
-10.3 Punkte seit Ausgangsstand
4 von 135 Fachfragen · 71.1 % vollständig richtig, 25.9 % teilweise
Rechnen mit deinen Angaben
100 %
6 von 6 Rechenaufgaben richtig, etwa Budget minus Grundstück oder Prozent einer Offerte
Manipulationsversuche abgewehrt
91.7 %
11 von 12 Versuchen, dem Assistenten über Dokumente oder Fragen fremde Anweisungen unterzuschieben
Korrektheit nach Wissensbereich
Dieselben Fachfragen, nach den vier Säulen der Wissensbasis gruppiert. Punkte von 100.
- Bau-Prozesslogik84.3
- Schweizer Recht & Normen81.2
- Erfahrungswissen85
- Grundlagenwissen86.7
Der Verlauf
Von 72.2 auf 84.1 Punkte
Fachliche Korrektheit je ausgeliefertem Stand, gemessen mit demselben Fragenkatalog. Nur Stände, die tatsächlich in Betrieb gingen; Experimente, die wir verworfen haben, stehen in der Tabelle darunter. Der gestrichelte Punkt am Ende ist der heutige Stand: ausgeliefert, aber noch nicht gemessen. Er bekommt bewusst keinen Wert – eine Kurve, die dorthin weiterläuft, würde eine Messung behaupten, die es nicht gibt. Der nächste Lauf ist für den 1. Oktober 2026 geplant.
| Version | Korrektheit | Mit Fehlern | Was sich geändert hat |
|---|---|---|---|
| v27 | 72.2 | 13.3 % | Ausgangsstand |
| v28 | 77 | 7.4 % | Präzisierte Regeln: Rechnen mit Nutzerangaben, Dokumente als Daten |
| v29 | 80.4 | 5.9 % | Zitat-Nachcheck, Kanton-Erkennung, modularer Aufbau |
| v31 | 82.6 | 3.7 % | Eigene Grundlagentexte zitierbar, Deep-Check-Empfehlung |
| v38 | 86.3 | 2.2 % | Amtliche Kostenquellen (BFS-Einheitspreise, BFE, Kantone), Gemeinde-Schutz ohne Baureglement, Retrieval-Wiederholung, Marker-Regel m²/m³. Gemessen auf Version 36; bis Version 38 nur Konto und Deep-Check-Abrechnung geändert, Prompt und Wissensbasis unverändert. |
| v58 | 84.1 | 3 % | Erster vollstaendiger Lauf auf Gemini 3.5 Flash-Lite und mit dem ueberarbeiteten Pruefverfahren – dazu die Reparatur der Quellenangaben, die vorher als unlesbare Klammern geschrieben wurden. |
| 2. Sept. 2026verworfen | Grundlagenwissen −18 Punkte, über alle Fragen 71.5 statt 72.2 | Harter Filter auf den gewählten KantonHielt kantonsfremde Quellen fern, schnitt aber auch einschlägige weg. | |
| 2. Sept. 2026verworfen | kein belegter Gewinn bei Korrektheit oder Belegtreue | Zusätzliche Nachbesserungsrunde je AntwortEine Reparaturrunde, die in jeder Antwort mitläuft, muss ihren Nutzen zeigen. | |
| 4. Sept. 2026verworfen | kein messbarer Unterschied bei der Zitat-Passung | Tiefere Fundstellen im Zitat (Artikel statt Erlass)Aufwand ohne Wirkung – die Genauigkeit hängt an der Quelle, nicht an der Anzeigetiefe. | |
| 1. Sept. 2026verworfen | höhere Korrektheit, aber ein Vielfaches der Kosten je Antwort | Das stärkere Modell als Standard (statt auf Knopfdruck)Die Kostengarantie muss auch den Nutzer mit 1'000 Fragen im Monat tragen. Das stärkere Modell bleibt als Deep-Check auf Knopfdruck. | |
| 11. Sept. 2026verworfen | Aufbautreue im Laienmodus 16 → 78 % (83 Fälle), Korrektheit unverändert – aber 59 statt 39 von 176 Antworten mit mindestens einer falsch zugeordneten Quellenangabe | Neue Darstellungsregel (Form folgt dem Inhalt)Der Gewinn bei der Lesbarkeit wiegt den Verlust bei der Nachprüfbarkeit nicht auf. Wird überarbeitet. | |
| 11. Sept. 2026verworfen | beste Trefferquote je Quellenangabe (6.3 % Fehler statt 17.9 %) und beste Korrektheit – geprüft nur auf 27 der 176 Fragen, pro Antwort nicht besser als der bisherige Stand | Das neueste, deutlich teurere Modell als StandardDer Vorteil ist auf dieser Fallzahl nicht belastbar, die Betriebskosten wären auf Dauer nicht tragbar, und der Anbieter sichert nur eine kurze Laufzeit zu. | |
| v58umgestelltund gemessen | belegt 129 statt 115 von 176 Antworten, einzelne Quellenangaben 93.8 statt 85.6 % passend, Antworten mit mindestens einer Fehlzuordnung 13.1 statt 22.2 Prozent, Antwortzeit 4.4 statt 6.6 s, Korrektheitsscore auf ähnlichem Niveau (84.1 statt 83.7) | v58 · Modellwechsel auf 3.5 Flash-LiteErgebnis des Modellvergleichs vom 10.–11. September; das bisherige Modell läuft beim Anbieter aus. Umgestellt am 11. September 2026 und mit dem Lauf vom selben Tag gemessen – die Zeile weiter oben ist dieser Messlauf, diese hier der Entscheid dahinter. | |
| v65ausgeliefertnoch nicht gemessen | – | Seit dem Messlauf weitergearbeitetSeit der Messung ausgeliefert und noch nicht mit dem Prüfkatalog gemessen: drei Korrekturen an der Darstellung der Quellenangaben und an sinnlosen Antwortanfängen – und die Umstellung aller Modelle hinter den Nebenfunktionen: Gegenprobe der Quellenangaben, vertiefte Zweitprüfung, Folgefragen und Gesprächstitel. | |
Die durchgestrichenen Zeilen sind Änderungen, die wir vollständig gemessen und dann nicht ausgeliefert haben. Sie tragen keine Versionsnummer, weil sie nie in Betrieb gingen – stattdessen steht dort das Prüfdatum. Sie stehen hier, weil ein Verlauf, in dem nur die gelungenen Schritte vorkommen, die Arbeit falsch darstellt. Die hervorgehobene Zeile ist die Änderung, zu der diese Versuche geführt haben – seit dem 11. September in Betrieb und mit dem Lauf vom selben Tag gemessen. Die gepunktete Zeile darunter ist der Stand, der seither dazugekommen ist: ausgeliefert, aber noch ohne eigene Messung. Er bekommt seine Zahlen mit dem nächsten vollständigen Lauf.
Untersuchungen
Woran wir gerade messen
Welches Sprachmodell soll Bauly künftig antworten lassen?
Umgestellt. Seit dem 11. September 2026 antwortet Bauly mit Gemini 3.5 Flash-Lite. Die übrigen Funktionen – Dokument-Analyse, Deep-Check, Chat – laufen vorerst weiter auf der bisherigen Modellgeneration; sie werden einzeln geprüft und umgestellt.
Aufbau und Messwerte nicht übernommen, wird überarbeitetHilft eine neue Regel für den Aufbau der Antworten?
Nicht übernommen. Gemessen wurde die Befolgung der Aufbauregel, nicht die Lesbarkeit – ob die Antworten dadurch besser zu lesen sind, haben wir nicht erhoben. Der Rückgang bei der Nachprüfbarkeit ist dagegen gemessen. Die Regel wird überarbeitet und erneut geprüft.
Aufbau und Messwerte umgestellt am 12. September 2026Hinter dem Assistenten arbeiten drei weitere Modelle – taugen ihre Nachfolger?
Umgestellt am 12. September 2026: Gegenprobe der Quellenangaben auf Gemini 3.1 Flash-Lite, vertiefte Zweitprüfung auf Gemini 3.5 Flash, Folgefragen und Titel auf Gemini 3.5 Flash-Lite. Damit läuft keine Funktion mehr auf einer auslaufenden Modellgeneration.
Aufbau und MesswerteDabei haben wir sieben Fehler im Prüfverfahren selbst gefunden – nicht im Assistenten, sondern in der Art, wie wir ihn messen. Sie stehen offen im Untersuchungsbericht, zusammen mit dem, was sie für die Zahlen oben bedeuten.
Was diese Zahlen nicht heissen
Auch das Prüfverfahren selbst hat Fehler. Wir haben sieben davon gefunden – sie stehen offen im Untersuchungsbericht, zusammen mit dem, was sie für die Zahlen auf dieser Seite bedeuten.
- Es ist eine automatisierte Eigenprüfung durch uns, kein unabhängiges Audit. Wir nennen deshalb Methode, Fallzahl und Stand, damit du die Zahlen einordnen kannst.
- Die Prüffragen haben wir selbst geschrieben. Sie decken die Themen ab, die wir für typisch halten, nicht jede Frage, die du stellen wirst.
- Ein gutes Ergebnis im Katalog ist keine Zusicherung für deine konkrete Antwort. Der Assistent gibt allgemeine Information, keine Beratung im Einzelfall (AGB Ziff. 3).
- Wird es verbindlich, empfiehlt der Assistent eine Fachperson. Das ist Teil des Konzepts, nicht ein Eingeständnis.
Stand und Rhythmus
Letzter Lauf: 11. September 2026, Version 58. Nächster Lauf: 1. Oktober 2026. Wir messen nach jeder grösseren Änderung am Assistenten und mindestens einmal im Monat mit demselben Katalog. Nach jedem Lauf aktualisieren wir diese Seite, den Verlauf und die Angaben im Impressum.