Het AI-agent betrouwbaarheidsrapport voor vastgoedbeheer

AI kan een gedeelde inbox lezen, klachten sorteren en monteurs plannen. De moeilijkere vraag voor elke eigenaar is eenvoudiger: kun je erop vertrouwen? Die twijfel is echt en gemeten. In het branche-onderzoek van AppFolio uit 2026 zei 78% van de vastgoedbeheerders de AI-functies in hun huidige software nog niet te vertrouwen. Terwijl de bedrijven die AI wél invoerden dit jaar 31% portefeuillegroei verwachten, bijna drie keer zoveel als de bedrijven die dat niet deden.

Editie 1 · Vastgoedbeheer · September 2026 · 15 pagina's

De omslag van het betrouwbaarheidsrapport, editie 1

WAT ER NIET MEER GEBEURT

Drie soorten handwerk die stilletjes de loonsom opvraten

De meeste leveranciers vertellen je dat hun AI nauwkeurig is. Wij laten liever de telling zien: hoeveel gevallen, over welke periode, door wie gecontroleerd, en waar het misging. Elk cijfer hieronder heeft een steekproefgrootte en een betrouwbaarheidsinterval in de bijlage. Waar een getal een projectie is, staat dat erbij.

Niemand leest de inbox meer

In onze vastgoedbeheeromgeving hebben we elk bericht dat het systeem in vier dagen afhandelde één voor één laten teruglezen door een mens. Het resultaat: 95% had helemaal geen menselijk antwoord nodig. Op dat zomertempo is een jaar van deze inbox 13.350 gelezen berichten, waarvan er maar 623 een mens nodig hebben. Bij één minuut per bericht is dat ruwweg 210 uur leeswerk per jaar dat niet meer plaatsvindt.

De rest heeft het systeem zelf gelezen, gesorteerd en doorgezet: facturen, leveranciersthreads, ruis. En het oordeelde juist. In een apart venster van 876 berichten negeerde het ongeveer negen van de tien rommelberichten terecht, terwijl het de ene echte noodmelding eruit pikte en als urgent markeerde. Omdat het software is, wordt de inbox om 3 uur 's nachts precies zo gelezen als om 3 uur 's middags: geen dienst, geen achterstand op maandagochtend.

95,3%

van de berichten had geen menselijk antwoord nodig

  • n = 150 · vier dagen
  • 95%-BI 90,7 – 97,7%

13.350 → 623

berichten per jaar, op het gemeten tempo

  • projectie
  • ≈ 210 uur leeswerk per jaar

Niemand plant de monteurs meer

In onze servicedienstomgeving plant de planningsengine de monteurs in: ze kent elke agenda, berekent reistijden en schrijft bij elke klus op waarom ze koos wie ze koos. Eén moment uit het planningslog: drie monteurs waren beschikbaar op 186, 56 en 34 minuten rijden. De engine stuurde die op 34 minuten, 22 minuten dichterbij dan de op één na beste keuze en 2½ uur dichterbij dan de slechtste. Vermenigvuldig die keuze met elke klus, elke week: dat is brandstof, uren en humeur waar je niet meer voor betaalt.

Bij een huurster die haar eigen voordeur niet meer op slot kreeg, koos de engine de monteur die een uur dichterbij was en vier dagen eerder kon dan het alternatief, en bundelde daarna een latere klus op hetzelfde adres, zodat één rit drie tickets oploste. Niemand heeft een agenda aangeraakt.

2½ uur

minder rijtijd dan de slechtste beschikbare keuze, op één klus

  • uit het planningslog
  • zomer 2026

1 rit

loste drie tickets op hetzelfde adres op

Niemand typt hetzelfde feit nog vier keer over

Als een melding binnenkomt, sorteert het systeem die in de juiste categorie (verwarming, lekkage, apparatuur), en die indeling bepaalt wie betaalt en wie wordt gebeld. We hebben dit op de harde manier getest: dezelfde gevallen, keer op keer aan het systeem gevoerd, over elke categorie die we afhandelen. Het gaf elke keer hetzelfde, juiste antwoord: 444 runs over alle 15 categorieën, nul afwijkingen. Een mens met een slechte dinsdag doet dat niet.

Vanuit die ene beslissing volgen het ticket, het antwoord aan de huurder in de taal van de huurder, de update aan de eigenaar en de werkbon automatisch.

444

runs over alle 15 categorieën, nul afwijkingen

  • getest vóór uitrol
  • 95%-BI 99,14 – 100%

Een servicelijn heeft geen nachtdienst meer nodig

In onze klantenserviceomgeving draait een complete WhatsApp-servicelijn op onze AI-medewerker: ze antwoordt dag en nacht, sorteert elke klacht, opent het ticket, en als een klant compensatie verdient, geeft ze zelf de kortingscode uit. Compensatie die geld kost, afgehandeld door software, binnen grenzen die ze niet kan overschrijden.

In één periode van twee weken handelde ze zo'n 215 gesprekken en taken per dag af. Van ruwweg 3.000 runs zijn er 3 gestopt of blijven hangen (99,9% runstabiliteit), en elk daarvan is opgemerkt door onze eigen monitoring, niet door een klant. In twaalf dagen kregen 36 klanten precies één code, niemand kreeg er twee, en in 120 bewust lastige gevallen is geen enkele echte klant onterecht geweigerd.

Toen er een beter AI-model beschikbaar kwam, zijn we overgestapt en hebben we de draaikosten van dit systeem met een factor twintig verlaagd, van ongeveer 11 cent per gesprek naar ruim onder een cent, gemeten over 4.939 gesprekken, met de kwaliteit opnieuw getest en op peil. Je automatisering wordt goedkoper naarmate ze rijpt, niet duurder.

99,90%

runstabiliteit van de servicelijn

  • n ≈ 3.015 · twee weken
  • 95%-BI 99,71 – 99,97%

€ 0,11 → < € 0,01

draaikosten per gesprek na de modelwissel

  • gemeten over 4.939 gesprekken

HOE WE METEN

Niets gaat live wat niet 19 van de 20 keer goed was

  1. 01

    Niets gaat live onder 19 van de 20

    Voordat een wijziging live gaat, draaien we haar twintig keer tegen dezelfde gevallen. Geeft ze niet minstens 19 van de 20 keer het juiste antwoord, dan gaat ze niet live. Punt.

  2. 02

    Honderden automatische controles, bij elke wijziging

    Als we iets aanpassen, test het systeem zichzelf opnieuw tegen zijn eigen geschiedenis. Na één recente wijziging hebben we 588 eerdere gevallen opnieuw gedraaid: geen enkele uitkomst veranderde die niet had mogen veranderen.

  3. 03

    Een mens controleert de uitkomsten

    Periodiek leest iemand die los staat van de bouw de uitkomsten één voor één terug, zoals bij de vierdaagse inboxcontrole hierboven, om te bevestigen dat het systeem deed wat het moest doen.

Van de drie controlelagen die we hebben gemeten, scoorde de zwakste 99,38% en het gepoolde resultaat over 1.638 runs 99,69%: hoe je het ook bekijkt een foutpercentage onder de 1%, met de volledige verantwoording in de tabel hieronder voor wie onze rekensom wil nakijken.

DE GRENZEN

Jij bepaalt wat ze mag versturen.

Niet wij, en niet de AI.

Of de AI zelfstandig berichten mag versturen of werkbonnen mag aanmaken, is een keuze die jij per proces maakt, nooit een standaardinstelling. Standaard kijkt een mens naar alles voordat het de deur uitgaat. Waar je bewust voor autonomie kiest, gebeurt het versturen door vaste, voorspelbare software die een goedgekeurd plan volgt, met een automatische inhoudscontrole, nooit door een AI die vrij improviseert.

  1. 01

    Onbekende leveranciers

    Een onbekende leverancier krijgt nooit een werkbon; jij krijgt in plaats daarvan een melding.

  2. 02

    Boven het mandaat

    Kosten boven het mandaat dat jij instelt, leiden eerst tot een goedkeuringsverzoek.

  3. 03

    Twijfel

    Als het systeem het niet zeker weet, stopt het en geeft het het geval met een samenvatting aan een mens; het gokt niet.

Het werk dat jouw team niet zou moeten doen, is bij ons al verdwenen.
Onafhankelijk onderzoek over klantenservice meldt 1,9 minuut voor een afhandeling door AI tegen 11,4 minuut door een mens. Andere processen dan de onze en niet één op één vergelijkbaar, maar de richting is onmiskenbaar.

VANAF DAG ÉÉN

Waar je ons aan mag houden

Als je met Triad werkt, zijn dit geen ambities. Het zijn de regels waaronder de cijfers hierboven tot stand zijn gekomen, en ze gelden vanaf dag één voor jouw implementatie. Dit rapport is het eerste in een reeks; elke volgende editie voegt nieuwe implementaties en verse cijfers toe.

  1. 01

    Niets gaat live onder 19 van de 20

    Elk proces wordt twintig keer tegen jouw eigen gevallen gedraaid voordat het je inbox, je huurders of je leveranciers raakt.

  2. 02

    Elk cijfer komt met zijn telling

    Je krijgt dezelfde verantwoording die je net hebt gelezen: steekproefgrootte, periode, missers. Maandelijks, voor je eigen organisatie.

  3. 03

    Een mens controleert de uitkomsten

    Iemand die los staat van de bouw leest volgens een vast schema echte uitkomsten terug, en de missers worden aan jou gerapporteerd, niet weggestopt.

  4. 04

    Jij bepaalt wat ze mag versturen

    Autonomie wordt per proces aangezet, door jou, nooit standaard. Onbekende leveranciers, kosten boven je mandaat en twijfelgevallen gaan altijd naar een mens.

BIJLAGE A

Hoe we hebben geteld

Elk cijfer in dit rapport, met steekproefgrootte, meetperiode en 95%-betrouwbaarheidsinterval (Wilson-methode). Een cijfer zonder interval is een schatting die zich voordoet als feit. De steekproefgroottes hieronder zijn de daadwerkelijk gemeten aantallen; de jaarvolumes in de tekst zijn deze gemeten tempo's geprojecteerd naar een jaar.

  • Inboxtellingn=15095,3%95%-interval 90,7 tot 97,7%
  • Intake, beslislaagn=32099,38%95%-interval 97,75 tot 99,83%
  • Consistentie classificatien=444100%95%-interval 99,14 tot 100%
  • Herhaling na een wijzigingn=588100%95%-interval 99,35 tot 100%
  • Drie controlelagen samenn=1.63899,69%95%-interval 99,29 tot 99,87%
  • Servicelijn, runstabiliteitn=3.01599,90%95%-interval 99,71 tot 99,97%
Elke stip is een gemeten uitkomst, elke balk het 95%-betrouwbaarheidsinterval. De balk van de inboxtelling (n=150) is breed, die van de servicelijn (n=3.015) bijna een streepje: hetzelfde vertrouwen kost meer runs.
Cijfer, zoals in de tekstnResultaat95%-BIHoe gemeten
Inboxtelling: aandeel zonder menselijk antwoord15095,3%90,7 – 97,7%elk bericht over 4 dagen, teruggelezen door iemand los van de bouw; 143 van 150 hadden geen actie nodig, 7 wel
Inboxtelling: juist doorgezet15099,33%96,32 – 99,88%zelfde telling; 1 echte misser, regel dezelfde week hersteld
Rommelfilter876≈ 90%87,79 – 91,77%apart venster; rommelberichten terecht genegeerd, 1 echte noodmelding in het venster, als urgent gemarkeerd
Consistentie classificatie444100%99,14 – 100%dezelfde gevallen herhaald over alle 15 categorieën, getest vóór uitrol; 0 afwijkingen
Herhaling na een wijziging (regressie)588100%99,35 – 100%eerdere gevallen opnieuw gedraaid na één wijziging; 0 uitkomsten veranderd die niet hadden mogen veranderen
Melderherkenning (intake)5988,14%77,48 – 94,13%bruto; 3 van 7 missers waren externe partijen die terecht niet gekoppeld zijn (netto 93%)
Intake: beslislaag agent32099,38%97,75 – 99,83%gemeten runs; beide fouten opgevangen door automatische herhaling
Servicelijn: runstabiliteit≈ 3.01599,90%99,71 – 99,97%opeenvolgende runs over 2 weken, 3 incidenten (runs gestopt of blijven hangen), alle zelf gedetecteerd; meet afronding, niet antwoordkwaliteit
Servicelijn: end-to-end proces69799,57%98,74 – 99,85%gemeten runs, venster van 2 weken, 3 fouten
Servicelijn: klantopzoekstap621100,00%99,39 – 100%gemeten runs, venster van 2 weken, 0 fouten
Servicelijn: compensatiegrenzen1200 onterecht geweigerdn.v.t.twee onafhankelijke adversariële rondes van 60 runs; 36 codes uitgegeven in 12 dagen, 0 dubbele
Servicelijn: kosten per gesprek4.939€ 0,11 → onder € 0,01n.v.t.draaikosten vóór en na de modelwissel, kwaliteit opnieuw getest op dezelfde gevallen
Gepoolde controlelagen1.63899,69%99,29 – 99,87%end-to-end proces + beslislaag agent + opzoekstap; worstcasefout 0,71%, onder de 1% uit de tekst

Waar de externe cijfers vandaan komen

  1. 01

    AppFolio, Property Manager Benchmark Survey 2026. Cijfers gecontroleerd tegen de live pagina op 26-08-2026. De 78% betreft AI-functies in bestaande vastgoedbeheersoftware. appfolio.com

  2. 02

    Digital Applied, Customer Service AI Agent Statistics 2026, een bundeling van onderzoek van Zendesk, Salesforce, Gartner, Forrester, Intercom en McKinsey. Gecontroleerd op 26-08-2026. digitalapplied.com

  3. 03

    Towards a Science of AI Agent Reliability, arXiv:2602.16666, ICML 2026: het onderzoeksstandpunt dat de herhaalde-metingaanpak van dit rapport volgt. Gecontroleerd op 26-08-2026. arxiv.org

Book a call