Hackaday · Maken
Generatieve AI draaien op een RP2350
Een project demonstreert het draaien van een beeldgenererend diffusiemodel op een RP2350 microcontroller, gedreven door interesses in privacy, aanpassing en kostenreductie voor lokale AI.

Het model genereert 128x128 beelden van menselijke gezichten, waarbij elk beeld ongeveer twintig seconden duurt om te produceren, wat opmerkelijk is gezien de beperkingen van de hardware. Het systeem maakt gebruik van een Waveshare RP2350 ontwikkelbord en kan beelden via USB uitvoeren of weergeven met een VGA-adapter.
Het beeldgeneratieproces omvat het creëren van een distributie in een latente ruimte, die vervolgens door de decodercomponent van een variationele auto-encoder naar een beeld wordt vertaald. De auto-encoder werd in twee fasen getraind: een encoder om beelden naar latente ruimte-distributies te mappen en een decoder om beelden uit deze distributies te reconstrueren. Voor generatie wordt alleen de decoder gebruikt.
Het generatieve deel van het model maakt gebruik van een latente flow diffusie transformator. Het begint met ruis en verfijnt deze iteratief om het doelbeeld te benaderen. Het model kan ook worden geleid door een outputklasse, zoals het genereren van een lachend gezicht.
[Tim] trainde twee modellen, één geoptimaliseerd voor snelheid en een ander voor grootte, en kwantiseerde hun gewichten naar 8-bits integers. Beide modellen en het inferentieprogramma passen binnen 4 MB aan flashgeheugen. De gegenereerde beelden zijn, hoewel niet perfect natuurlijk, herkenbaar.
AI-samenvatting op basis van de bron.
Hackaday