Het AI-agent betrouwbaarheidsrapport voor vastgoedbeheer
AI kan een gedeelde inbox lezen, klachten sorteren en monteurs plannen. De moeilijkere vraag voor elke eigenaar is eenvoudiger: kun je erop vertrouwen? Die twijfel is echt en gemeten. In het branche-onderzoek van AppFolio uit 2026 zei 78% van de vastgoedbeheerders de AI-functies in hun huidige software nog niet te vertrouwen. Terwijl de bedrijven die AI wél invoerden dit jaar 31% portefeuillegroei verwachten, bijna drie keer zoveel als de bedrijven die dat niet deden.

WAT ER NIET MEER GEBEURT
Drie soorten handwerk die stilletjes de loonsom opvraten
De meeste leveranciers vertellen je dat hun AI nauwkeurig is. Wij laten liever de telling zien: hoeveel gevallen, over welke periode, door wie gecontroleerd, en waar het misging. Elk cijfer hieronder heeft een steekproefgrootte en een betrouwbaarheidsinterval in de bijlage. Waar een getal een projectie is, staat dat erbij.
Niemand leest de inbox meer
In onze vastgoedbeheeromgeving hebben we elk bericht dat het systeem in vier dagen afhandelde één voor één laten teruglezen door een mens. Het resultaat: 95% had helemaal geen menselijk antwoord nodig. Op dat zomertempo is een jaar van deze inbox 13.350 gelezen berichten, waarvan er maar 623 een mens nodig hebben. Bij één minuut per bericht is dat ruwweg 210 uur leeswerk per jaar dat niet meer plaatsvindt.
De rest heeft het systeem zelf gelezen, gesorteerd en doorgezet: facturen, leveranciersthreads, ruis. En het oordeelde juist. In een apart venster van 876 berichten negeerde het ongeveer negen van de tien rommelberichten terecht, terwijl het de ene echte noodmelding eruit pikte en als urgent markeerde. Omdat het software is, wordt de inbox om 3 uur 's nachts precies zo gelezen als om 3 uur 's middags: geen dienst, geen achterstand op maandagochtend.
95,3%
van de berichten had geen menselijk antwoord nodig
13.350 → 623
berichten per jaar, op het gemeten tempo
Niemand plant de monteurs meer
In onze servicedienstomgeving plant de planningsengine de monteurs in: ze kent elke agenda, berekent reistijden en schrijft bij elke klus op waarom ze koos wie ze koos. Eén moment uit het planningslog: drie monteurs waren beschikbaar op 186, 56 en 34 minuten rijden. De engine stuurde die op 34 minuten, 22 minuten dichterbij dan de op één na beste keuze en 2½ uur dichterbij dan de slechtste. Vermenigvuldig die keuze met elke klus, elke week: dat is brandstof, uren en humeur waar je niet meer voor betaalt.
Bij een huurster die haar eigen voordeur niet meer op slot kreeg, koos de engine de monteur die een uur dichterbij was en vier dagen eerder kon dan het alternatief, en bundelde daarna een latere klus op hetzelfde adres, zodat één rit drie tickets oploste. Niemand heeft een agenda aangeraakt.
2½ uur
minder rijtijd dan de slechtste beschikbare keuze, op één klus
1 rit
loste drie tickets op hetzelfde adres op
Niemand typt hetzelfde feit nog vier keer over
Als een melding binnenkomt, sorteert het systeem die in de juiste categorie (verwarming, lekkage, apparatuur), en die indeling bepaalt wie betaalt en wie wordt gebeld. We hebben dit op de harde manier getest: dezelfde gevallen, keer op keer aan het systeem gevoerd, over elke categorie die we afhandelen. Het gaf elke keer hetzelfde, juiste antwoord: 444 runs over alle 15 categorieën, nul afwijkingen. Een mens met een slechte dinsdag doet dat niet.
Vanuit die ene beslissing volgen het ticket, het antwoord aan de huurder in de taal van de huurder, de update aan de eigenaar en de werkbon automatisch.
444
runs over alle 15 categorieën, nul afwijkingen
Een servicelijn heeft geen nachtdienst meer nodig
In onze klantenserviceomgeving draait een complete WhatsApp-servicelijn op onze AI-medewerker: ze antwoordt dag en nacht, sorteert elke klacht, opent het ticket, en als een klant compensatie verdient, geeft ze zelf de kortingscode uit. Compensatie die geld kost, afgehandeld door software, binnen grenzen die ze niet kan overschrijden.
In één periode van twee weken handelde ze zo'n 215 gesprekken en taken per dag af. Van ruwweg 3.000 runs zijn er 3 gestopt of blijven hangen (99,9% runstabiliteit), en elk daarvan is opgemerkt door onze eigen monitoring, niet door een klant. In twaalf dagen kregen 36 klanten precies één code, niemand kreeg er twee, en in 120 bewust lastige gevallen is geen enkele echte klant onterecht geweigerd.
Toen er een beter AI-model beschikbaar kwam, zijn we overgestapt en hebben we de draaikosten van dit systeem met een factor twintig verlaagd, van ongeveer 11 cent per gesprek naar ruim onder een cent, gemeten over 4.939 gesprekken, met de kwaliteit opnieuw getest en op peil. Je automatisering wordt goedkoper naarmate ze rijpt, niet duurder.
99,90%
runstabiliteit van de servicelijn
€ 0,11 → < € 0,01
draaikosten per gesprek na de modelwissel
HOE WE METEN
Niets gaat live wat niet 19 van de 20 keer goed was
- 01
Niets gaat live onder 19 van de 20
Voordat een wijziging live gaat, draaien we haar twintig keer tegen dezelfde gevallen. Geeft ze niet minstens 19 van de 20 keer het juiste antwoord, dan gaat ze niet live. Punt.
- 02
Honderden automatische controles, bij elke wijziging
Als we iets aanpassen, test het systeem zichzelf opnieuw tegen zijn eigen geschiedenis. Na één recente wijziging hebben we 588 eerdere gevallen opnieuw gedraaid: geen enkele uitkomst veranderde die niet had mogen veranderen.
- 03
Een mens controleert de uitkomsten
Periodiek leest iemand die los staat van de bouw de uitkomsten één voor één terug, zoals bij de vierdaagse inboxcontrole hierboven, om te bevestigen dat het systeem deed wat het moest doen.
Van de drie controlelagen die we hebben gemeten, scoorde de zwakste 99,38% en het gepoolde resultaat over 1.638 runs 99,69%: hoe je het ook bekijkt een foutpercentage onder de 1%, met de volledige verantwoording in de tabel hieronder voor wie onze rekensom wil nakijken.
DE GRENZEN
Jij bepaalt wat ze mag versturen.
Niet wij, en niet de AI.
Of de AI zelfstandig berichten mag versturen of werkbonnen mag aanmaken, is een keuze die jij per proces maakt, nooit een standaardinstelling. Standaard kijkt een mens naar alles voordat het de deur uitgaat. Waar je bewust voor autonomie kiest, gebeurt het versturen door vaste, voorspelbare software die een goedgekeurd plan volgt, met een automatische inhoudscontrole, nooit door een AI die vrij improviseert.
- 01
Onbekende leveranciers
Een onbekende leverancier krijgt nooit een werkbon; jij krijgt in plaats daarvan een melding.
- 02
Boven het mandaat
Kosten boven het mandaat dat jij instelt, leiden eerst tot een goedkeuringsverzoek.
- 03
Twijfel
Als het systeem het niet zeker weet, stopt het en geeft het het geval met een samenvatting aan een mens; het gokt niet.
Het werk dat jouw team niet zou moeten doen, is bij ons al verdwenen.
VANAF DAG ÉÉN
Waar je ons aan mag houden
Als je met Triad werkt, zijn dit geen ambities. Het zijn de regels waaronder de cijfers hierboven tot stand zijn gekomen, en ze gelden vanaf dag één voor jouw implementatie. Dit rapport is het eerste in een reeks; elke volgende editie voegt nieuwe implementaties en verse cijfers toe.
- 01
Niets gaat live onder 19 van de 20
Elk proces wordt twintig keer tegen jouw eigen gevallen gedraaid voordat het je inbox, je huurders of je leveranciers raakt.
- 02
Elk cijfer komt met zijn telling
Je krijgt dezelfde verantwoording die je net hebt gelezen: steekproefgrootte, periode, missers. Maandelijks, voor je eigen organisatie.
- 03
Een mens controleert de uitkomsten
Iemand die los staat van de bouw leest volgens een vast schema echte uitkomsten terug, en de missers worden aan jou gerapporteerd, niet weggestopt.
- 04
Jij bepaalt wat ze mag versturen
Autonomie wordt per proces aangezet, door jou, nooit standaard. Onbekende leveranciers, kosten boven je mandaat en twijfelgevallen gaan altijd naar een mens.
BIJLAGE A
Hoe we hebben geteld
Elk cijfer in dit rapport, met steekproefgrootte, meetperiode en 95%-betrouwbaarheidsinterval (Wilson-methode). Een cijfer zonder interval is een schatting die zich voordoet als feit. De steekproefgroottes hieronder zijn de daadwerkelijk gemeten aantallen; de jaarvolumes in de tekst zijn deze gemeten tempo's geprojecteerd naar een jaar.
- Inboxtellingn=15095,3%95%-interval 90,7 tot 97,7%
- Intake, beslislaagn=32099,38%95%-interval 97,75 tot 99,83%
- Consistentie classificatien=444100%95%-interval 99,14 tot 100%
- Herhaling na een wijzigingn=588100%95%-interval 99,35 tot 100%
- Drie controlelagen samenn=1.63899,69%95%-interval 99,29 tot 99,87%
- Servicelijn, runstabiliteitn=3.01599,90%95%-interval 99,71 tot 99,97%
| Cijfer, zoals in de tekst | n | Resultaat | 95%-BI | Hoe gemeten |
|---|---|---|---|---|
| Inboxtelling: aandeel zonder menselijk antwoord | 150 | 95,3% | 90,7 – 97,7% | elk bericht over 4 dagen, teruggelezen door iemand los van de bouw; 143 van 150 hadden geen actie nodig, 7 wel |
| Inboxtelling: juist doorgezet | 150 | 99,33% | 96,32 – 99,88% | zelfde telling; 1 echte misser, regel dezelfde week hersteld |
| Rommelfilter | 876 | ≈ 90% | 87,79 – 91,77% | apart venster; rommelberichten terecht genegeerd, 1 echte noodmelding in het venster, als urgent gemarkeerd |
| Consistentie classificatie | 444 | 100% | 99,14 – 100% | dezelfde gevallen herhaald over alle 15 categorieën, getest vóór uitrol; 0 afwijkingen |
| Herhaling na een wijziging (regressie) | 588 | 100% | 99,35 – 100% | eerdere gevallen opnieuw gedraaid na één wijziging; 0 uitkomsten veranderd die niet hadden mogen veranderen |
| Melderherkenning (intake) | 59 | 88,14% | 77,48 – 94,13% | bruto; 3 van 7 missers waren externe partijen die terecht niet gekoppeld zijn (netto 93%) |
| Intake: beslislaag agent | 320 | 99,38% | 97,75 – 99,83% | gemeten runs; beide fouten opgevangen door automatische herhaling |
| Servicelijn: runstabiliteit | ≈ 3.015 | 99,90% | 99,71 – 99,97% | opeenvolgende runs over 2 weken, 3 incidenten (runs gestopt of blijven hangen), alle zelf gedetecteerd; meet afronding, niet antwoordkwaliteit |
| Servicelijn: end-to-end proces | 697 | 99,57% | 98,74 – 99,85% | gemeten runs, venster van 2 weken, 3 fouten |
| Servicelijn: klantopzoekstap | 621 | 100,00% | 99,39 – 100% | gemeten runs, venster van 2 weken, 0 fouten |
| Servicelijn: compensatiegrenzen | 120 | 0 onterecht geweigerd | n.v.t. | twee onafhankelijke adversariële rondes van 60 runs; 36 codes uitgegeven in 12 dagen, 0 dubbele |
| Servicelijn: kosten per gesprek | 4.939 | € 0,11 → onder € 0,01 | n.v.t. | draaikosten vóór en na de modelwissel, kwaliteit opnieuw getest op dezelfde gevallen |
| Gepoolde controlelagen | 1.638 | 99,69% | 99,29 – 99,87% | end-to-end proces + beslislaag agent + opzoekstap; worstcasefout 0,71%, onder de 1% uit de tekst |
Waar de externe cijfers vandaan komen
- 01
AppFolio, Property Manager Benchmark Survey 2026. Cijfers gecontroleerd tegen de live pagina op 26-08-2026. De 78% betreft AI-functies in bestaande vastgoedbeheersoftware. appfolio.com
- 02
Digital Applied, Customer Service AI Agent Statistics 2026, een bundeling van onderzoek van Zendesk, Salesforce, Gartner, Forrester, Intercom en McKinsey. Gecontroleerd op 26-08-2026. digitalapplied.com
- 03
Towards a Science of AI Agent Reliability, arXiv:2602.16666, ICML 2026: het onderzoeksstandpunt dat de herhaalde-metingaanpak van dit rapport volgt. Gecontroleerd op 26-08-2026. arxiv.org