Zum Inhalt

Prüfstand

So prüfen und verbessern wir Bauly.

Bauly wird mit einem festen Katalog von Baufragen geprüft. Ein zweites KI-Modell bewertet jede Antwort gegen eine vorab hinterlegte Prüfzeile – eine automatisierte Eigenprüfung, kein unabhängiges Audit. Wir veröffentlichen die Ergebnisse, untersuchen Fehler und zeigen, welche Änderungen wir übernehmen und welche nicht.

Im Einsatz

Gemini 3.5 Flash-Lite

seit 11. September 2026, vorher Gemini 2.5 Flash. Umgestellt als Ergebnis des Modellvergleichs. Die drei Modelle hinter den Nebenfunktionen wurden am 11./12. September einzeln geprüft und umgestellt: Gegenprobe der Quellenangaben auf Gemini 3.1 Flash-Lite, vertiefte Zweitprüfung auf Gemini 3.5 Flash, Folgefragen und Gesprächstitel auf Gemini 3.5 Flash-Lite.

Letzter Vergleich

10.–11. September 2026, 176 Fragen

Vier Sprachmodelle und eine neue Regel für den Antwortaufbau, jeweils mit denselben Fragen und denselben Quellen.

Messverfahren

überarbeitet im September 2026

Wir haben sieben Fehler im eigenen Prüfverfahren gefunden und behoben. Ergebnisse von vor dieser Überarbeitung sind mit späteren nur eingeschränkt vergleichbar.

Wie wir prüfen

4'879 bewertete Antworten

In 31 Messläufen seit dem Ausgangsstand, jede Antwort einzeln vom Richter beurteilt – darunter 295 Vergleiche mit dem Deep-Check-Modell. Verworfene Experimente zählen mit, denn auch sie wurden vollständig gemessen.

176 Prüffragen

135 Fachfragen aus vier Wissensbereichen zu 27 Themen – je drei, wie sie im Alltag gestellt werden, und zwei schwierige mit Fristen, Werten und Normbezug – dazu 41 Zusatzfälle für Rechenaufgaben, Manipulationsversuche, Themen ausserhalb des Bauens und die Übergabe an Fachpersonen.

Eine Prüfzeile pro Frage

Jede Frage trägt vorab den erwarteten Kern der Antwort: die Frist, den Wert, die Norm oder die Kernaussage, an der sich entscheidet, ob die Antwort trägt. Die Prüffragen sind redaktionell erstellt; wir übernehmen keine Fragen aus Nutzergesprächen.

Ein zweites Modell als Richter

Ein leistungsfähigeres KI-Modell, das an der Antwort nicht beteiligt war, bewertet jede Antwort gegen die Prüfzeile und liest die zitierten Quellen mit. Es vergibt drei Stufen: vollständig richtig, teilweise richtig, falsch.

Die Zahlen

Messung vom 11. September 2026, Version 58

Erhoben auf Gemini 3.5 Flash-Lite, dem Modell, mit dem Bauly seit 11. September 2026 antwortet. Diese Zahlen stammen erstmals vom heute eingesetzten Modell und aus dem überarbeiteten Prüfverfahren. Mit dem Stand vom 3. September sind sie deshalb nur eingeschränkt vergleichbar: Der Korrektheitsscore fällt allein durch das strengere Prüfverfahren um rund zwei Punkte tiefer aus, und die Zahl der Prüffragen ist von 165 auf 176 gewachsen.

Fachliche Korrektheit

84.1von 100

+11.9 seit Ausgangsstand

135 Fachfragen · vollständig richtig zählt 2 Punkte, teilweise 1, falsch 0

Antworten mit fachlichen Fehlern

3 %

-10.3 Punkte seit Ausgangsstand

4 von 135 Fachfragen · 71.1 % vollständig richtig, 25.9 % teilweise

Rechnen mit deinen Angaben

100 %

6 von 6 Rechenaufgaben richtig, etwa Budget minus Grundstück oder Prozent einer Offerte

Manipulationsversuche abgewehrt

91.7 %

11 von 12 Versuchen, dem Assistenten über Dokumente oder Fragen fremde Anweisungen unterzuschieben

Korrektheit nach Wissensbereich

Dieselben Fachfragen, nach den vier Säulen der Wissensbasis gruppiert. Punkte von 100.

  • Bau-Prozesslogik
    84.3
  • Schweizer Recht & Normen
    81.2
  • Erfahrungswissen
    85
  • Grundlagenwissen
    86.7

Der Verlauf

Von 72.2 auf 84.1 Punkte

Fachliche Korrektheit je ausgeliefertem Stand, gemessen mit demselben Fragenkatalog. Nur Stände, die tatsächlich in Betrieb gingen; Experimente, die wir verworfen haben, stehen in der Tabelle darunter. Der gestrichelte Punkt am Ende ist der heutige Stand: ausgeliefert, aber noch nicht gemessen. Er bekommt bewusst keinen Wert – eine Kurve, die dorthin weiterläuft, würde eine Messung behaupten, die es nicht gibt. Der nächste Lauf ist für den 1. Oktober 2026 geplant.

0255075100?v65nicht gemessenv27Ausgangsstandv28Stufe 1v29Stufe 2v31Stufe 3v38Stufe 4v58Stufe 572.284.1
VersionKorrektheitMit FehlernWas sich geändert hat
v2772.213.3 %Ausgangsstand
v28777.4 %Präzisierte Regeln: Rechnen mit Nutzerangaben, Dokumente als Daten
v2980.45.9 %Zitat-Nachcheck, Kanton-Erkennung, modularer Aufbau
v3182.63.7 %Eigene Grundlagentexte zitierbar, Deep-Check-Empfehlung
v3886.32.2 %Amtliche Kostenquellen (BFS-Einheitspreise, BFE, Kantone), Gemeinde-Schutz ohne Baureglement, Retrieval-Wiederholung, Marker-Regel m²/m³. Gemessen auf Version 36; bis Version 38 nur Konto und Deep-Check-Abrechnung geändert, Prompt und Wissensbasis unverändert.
v5884.13 %Erster vollstaendiger Lauf auf Gemini 3.5 Flash-Lite und mit dem ueberarbeiteten Pruefverfahren – dazu die Reparatur der Quellenangaben, die vorher als unlesbare Klammern geschrieben wurden.
2. Sept. 2026verworfenGrundlagenwissen −18 Punkte, über alle Fragen 71.5 statt 72.2Harter Filter auf den gewählten KantonHielt kantonsfremde Quellen fern, schnitt aber auch einschlägige weg.
2. Sept. 2026verworfenkein belegter Gewinn bei Korrektheit oder BelegtreueZusätzliche Nachbesserungsrunde je AntwortEine Reparaturrunde, die in jeder Antwort mitläuft, muss ihren Nutzen zeigen.
4. Sept. 2026verworfenkein messbarer Unterschied bei der Zitat-PassungTiefere Fundstellen im Zitat (Artikel statt Erlass)Aufwand ohne Wirkung – die Genauigkeit hängt an der Quelle, nicht an der Anzeigetiefe.
1. Sept. 2026verworfenhöhere Korrektheit, aber ein Vielfaches der Kosten je AntwortDas stärkere Modell als Standard (statt auf Knopfdruck)Die Kostengarantie muss auch den Nutzer mit 1'000 Fragen im Monat tragen. Das stärkere Modell bleibt als Deep-Check auf Knopfdruck.
11. Sept. 2026verworfenAufbautreue im Laienmodus 16 → 78 % (83 Fälle), Korrektheit unverändert – aber 59 statt 39 von 176 Antworten mit mindestens einer falsch zugeordneten QuellenangabeNeue Darstellungsregel (Form folgt dem Inhalt)Der Gewinn bei der Lesbarkeit wiegt den Verlust bei der Nachprüfbarkeit nicht auf. Wird überarbeitet.
11. Sept. 2026verworfenbeste Trefferquote je Quellenangabe (6.3 % Fehler statt 17.9 %) und beste Korrektheit – geprüft nur auf 27 der 176 Fragen, pro Antwort nicht besser als der bisherige StandDas neueste, deutlich teurere Modell als StandardDer Vorteil ist auf dieser Fallzahl nicht belastbar, die Betriebskosten wären auf Dauer nicht tragbar, und der Anbieter sichert nur eine kurze Laufzeit zu.
v58umgestelltund gemessenbelegt 129 statt 115 von 176 Antworten, einzelne Quellenangaben 93.8 statt 85.6 % passend, Antworten mit mindestens einer Fehlzuordnung 13.1 statt 22.2 Prozent, Antwortzeit 4.4 statt 6.6 s, Korrektheitsscore auf ähnlichem Niveau (84.1 statt 83.7)v58 · Modellwechsel auf 3.5 Flash-LiteErgebnis des Modellvergleichs vom 10.–11. September; das bisherige Modell läuft beim Anbieter aus. Umgestellt am 11. September 2026 und mit dem Lauf vom selben Tag gemessen – die Zeile weiter oben ist dieser Messlauf, diese hier der Entscheid dahinter.
v65ausgeliefertnoch nicht gemessenSeit dem Messlauf weitergearbeitetSeit der Messung ausgeliefert und noch nicht mit dem Prüfkatalog gemessen: drei Korrekturen an der Darstellung der Quellenangaben und an sinnlosen Antwortanfängen – und die Umstellung aller Modelle hinter den Nebenfunktionen: Gegenprobe der Quellenangaben, vertiefte Zweitprüfung, Folgefragen und Gesprächstitel.

Die durchgestrichenen Zeilen sind Änderungen, die wir vollständig gemessen und dann nicht ausgeliefert haben. Sie tragen keine Versionsnummer, weil sie nie in Betrieb gingen – stattdessen steht dort das Prüfdatum. Sie stehen hier, weil ein Verlauf, in dem nur die gelungenen Schritte vorkommen, die Arbeit falsch darstellt. Die hervorgehobene Zeile ist die Änderung, zu der diese Versuche geführt haben – seit dem 11. September in Betrieb und mit dem Lauf vom selben Tag gemessen. Die gepunktete Zeile darunter ist der Stand, der seither dazugekommen ist: ausgeliefert, aber noch ohne eigene Messung. Er bekommt seine Zahlen mit dem nächsten vollständigen Lauf.

Was diese Zahlen nicht heissen

Auch das Prüfverfahren selbst hat Fehler. Wir haben sieben davon gefunden – sie stehen offen im Untersuchungsbericht, zusammen mit dem, was sie für die Zahlen auf dieser Seite bedeuten.

  • Es ist eine automatisierte Eigenprüfung durch uns, kein unabhängiges Audit. Wir nennen deshalb Methode, Fallzahl und Stand, damit du die Zahlen einordnen kannst.
  • Die Prüffragen haben wir selbst geschrieben. Sie decken die Themen ab, die wir für typisch halten, nicht jede Frage, die du stellen wirst.
  • Ein gutes Ergebnis im Katalog ist keine Zusicherung für deine konkrete Antwort. Der Assistent gibt allgemeine Information, keine Beratung im Einzelfall (AGB Ziff. 3).
  • Wird es verbindlich, empfiehlt der Assistent eine Fachperson. Das ist Teil des Konzepts, nicht ein Eingeständnis.

Stand und Rhythmus

Letzter Lauf: 11. September 2026, Version 58. Nächster Lauf: 1. Oktober 2026. Wir messen nach jeder grösseren Änderung am Assistenten und mindestens einmal im Monat mit demselben Katalog. Nach jedem Lauf aktualisieren wir diese Seite, den Verlauf und die Angaben im Impressum.