← Terug
Nieuw AI-framework StreetDiff verbetert consistentie in generatieve stadsgezichten

Nieuw AI-framework StreetDiff verbetert consistentie in generatieve stadsgezichten

Het creëren van geloofwaardige, driedimensionale stadsgezichten via kunstmatige intelligentie blijft een complexe uitdaging. Hoewel huidige multi-view diffusiemodellen effectief zijn in eenvoudige omgevingen, zoals open velden of kamers, ontstaan er vaak fouten bij het genereren van drukke stedelijke gebieden. Wanneer de camera in dergelijke scenario's roteert, treden vaak visuele inconsistenties op, variërend van vervormde gebouwen tot het onbedoeld dupliceren van objecten.

Om deze problemen op te lossen, hebben Qi Zhang en een team van onderzoekers StreetDiff ontwikkeld. Volgens een wetenschappelijke publicatie op arxiv.org is dit framework specifiek ontworpen om de uitlijning tussen verschillende weergaven tijdens het denoising-proces strikt af te dwingen. Hierdoor blijft de visuele samenhang behouden, zelfs in complexe scenario's.

Een centraal element van deze technologie is het 'Panorama--Perspective Synergy'-ontwerp. Dit mechanisme zorgt ervoor dat het model een duidelijk onderscheid maakt tussen de globale lay-out van de scène en de lokale details. Door deze twee aspecten te scheiden, kan het systeem een stabiel overzicht van de omgeving bewaren terwijl de fijne details per individueel beeld nauwkeurig worden ingevuld.

Daarnaast implementeert StreetDiff een Panorama Alignment Module (PAM). Deze module maakt gebruik van aandachtsbeschermingen die gebaseerd zijn op sferische projecties. Een belangrijk technisch voordeel is dat deze structurele beperkingen worden toegevoegd zonder dat de basisstructuur, de zogenaamde diffusion backbone, van het model aangepast hoeft te worden. Dit verhoogt de robuustheid van de visuele coherentie aanzienlijk, zoals verder beschreven in het onderzoek op .

Om de effectiviteit van het model te waarborgen, hebben de onderzoekers ook de Street360-dataset ontwikkeld. Dit is een omvangrijke collectie van stedelijke panorama's in High Dynamic Range (HDR), speciaal samengesteld voor multi-view toepassingen. De dataset is essentieel voor het trainen van AI-modellen om de complexe geometrie van stedelijke ruimtes correct te interpreteren. Experimenten tonen aan dat StreetDiff superieur is aan eerdere methoden, vooral wat betreft de structurele consistentie en visuele getrouwheid.

De ontwikkeling van StreetDiff weerspiegelt een bredere verschuiving binnen de computer vision, waarbij de focus verschuift van het genereren van losse beelden naar het waarborgen van ruimtelijke consistentie. Terwijl andere innovaties in de sector zich richten op verschillende modaliteiten, zoals de vooruitgang in spraakgeneratie bij deepmind.google, concentreert StreetDiff zich op de geometrische precisie van visuele ruimtes.

De integratie van sferische uitlijning en structurele prompts vormt een belangrijke stap in het begrip van AI over de opbouw van fysieke ruimtes. Dit opent nieuwe mogelijkheden voor stadsplanning, geavanceerde simulaties en virtuele werelden waarin een naadloze overgang tussen camerastandpunten noodzakelijk is. Het volledige verslag van dit onderzoek is sinds 9 september 2026 raadpleegbaar via de , waar de resultaten zijn gecategoriseerd onder Computer Vision and Pattern Recognition.

Geraadpleegde bronnen
PexelsRulo Moravia Pexels
Lees origineel artikel — Nieuws
Waardering
0
Stem mee op dit artikel
Discussie
Nog geen reacties. Wees de eerste!