Een team van wetenschappers heeft TabPFN-3.5 gelanceerd, een nieuw fundatiemodel dat specifiek is ontwikkeld voor het analyseren van tabulaire gegevens. Volgens de makers presteert dit model aanzienlijk beter dan zowel zijn voorganger als de huidige referentiemodellen in de sector. In een technisch rapport dat op 22 september 2026 in een herziene versie verscheen, wordt beschreven hoe het model een nieuwe standaard zet binnen de TabArena, een benchmark voor tabulaire voorspellingen. Volgens de arxiv.org overtreft TabPFN-3.5 de eerdere TabPFN-3 en alle huidige baselines bij een breed scala aan vraagstukken.
Focus op praktische toepasbaarheid
De nieuwste versie van het model richt zich sterk op scenario's die professionals in de praktijk tegenkomen. Waar oudere systemen vaak tekortschoten bij complexe datastructuren, is TabPFN-3.5 ontworpen voor uitdagende situaties. Dit omvat onder meer data met temporele of gegroepeerde splitsingen (non-i.i.d. data), alsook tabellen waarin tekst, strings en afbeeldingen zijn opgenomen.
Daarnaast is het model beter in staat om om te gaan met zogenaamde 'wide tables', waarbij sprake is van een zeer groot aantal kenmerken, en categorische features met een hoge cardinaliteit. Deze technische verbeteringen leiden tot betere resultaten bij het analyseren van relationele data en tijdreeksvoorspellingen, zoals verder toegelicht in de .
Verschillende varianten voor diverse behoeften
Om in te spelen op de behoeften van verschillende gebruikers, is TabPFN-3.5 in drie specifieke varianten uitgebracht:
- TabPFN-3.5-Fast: Deze versie is geoptimaliseerd voor snelheid en draait tot drie keer sneller dan de vorige generatie, zonder daarbij veel nauwkeurigheid in te leveren.
- TabPFN-3.5-Plus: Deze variant richt zich op multimodale capaciteiten, met geavanceerde verwerking van tekst en datums dankzij specifieke optimalisaties tijdens de inferentie.
- TabPFN-3.5-Thinking: In deze modus worden de berekeningen tijdens de inferentietijd opgeschaald om de prestaties te maximaliseren. Deze functie is tot twaalf keer sneller dan de vergelijkbare mogelijkheid in de vorige versie.
Evolutie van de technologie
De komst van versie 3.5 is een directe voortzetting van het werk aan TabPFN-3. In een arxiv.org werd TabPFN-3 al gepresenteerd als een belangrijke stap voorwaarts, aangezien het model kon schalen naar datasets met tot een miljoen trainingsrijen. Destijds bleek TabPFN-3 al superieur aan gradient-boosted-tree baselines die acht uur lang waren afgesteld, met name bij tabulaire tekst en relationele data.
De overgang naar versie 3.5 markeert een verdere verschuiving naar efficiëntie en veelzijdigheid. Terwijl de basis in werd gelegd met het gebruik van synthetische data tijdens de pretraining en de introductie van 'test-time compute scaling', perfectioneert de huidige versie deze processen voor data-experts.
Het ontwikkelingsteam bestaat uit tientallen experts, waaronder Bernhard Schölkopf en Yann LeCun. De resultaten van dit project bevestigen een bredere trend: fundatiemodellen, die oorspronkelijk vooral succesvol waren in de verwerking van natuurlijke taal, worden nu ook de dominante methode voor het analyseren van gestructureerde gegevens in zowel de industrie als de wetenschap.