Moet je je voorstellen, de hoeveelheid bijzondere creatieve keuzes die gemaakt worden door mensen die niet weten wat de norm is. Is een duiveltje op je schouder die je er op kan aanwijzen wanneer je iets doet wat buiten de norm valt dan echt behulpzaam, of geeft het je vooral meer zekerheid dat je gevoelsmatig geen fouten maakt omdat spannende keuzes juist een risico zijn?
Maar het aller aller belangrijkste wat ik eerder al zei:
Taalmodellen kunnen niet luisteren
Op geen enkel moment gaat jouw audio het taalmodel in.
Mogelijke lyrics worden omgezet naar tekst met whisper.ai. Ritme in de zang, pitch, intonatie en vele andere aspecten van de zang zijn vrijwel allemaal weg.
Audio word omgezet naar een spectogram. An sich niet erg, daar kun je met de benodigde wiskunde ook zeer veel nuttige informatie uit halen.
Echter bezitten taalmodellen niet de benodigde wiskundige functies om een spectogram als muziek zijnde te interpreteren, enkel als een foto zoals elk ander in de dataset.
Die foto word geanalyseert op patronen, een gat hier, een groot fel blok daar. Dat word aangevuld met gerelateerde patronen uit de dataset en aanverwante contextueel relevante data. Meer algemene teksten over spectogrammen bijvoorbeeld, een leeg vlak is stilte, dit niet, die kleur betekent veel bas.
Maar zeer waarschijnlijk dus ook gesprekken op muziekfora rondom vergelijkbare beschrijvingen van een spectogram en waar bijvoorbeeld wel tekst omheen staat over baslijnen en andere meer muzikale beschrijvingen.
Bovendien geven mensen zelf al belangrijke context waar een taalmodel naar kan grijpen. Zo vraag je misschien iets over of het baslijntje hard genoeg is. Met die informatie 'hallucineert' een taalmodel lekker. Die patronen die jij zelf toevoegd aan de context worden weer gebruikt voor antwoorden. Zo is het makkelijk om bij een uitkomst te komen waar de feedback over de dynamiek van je bas er uit rolt. Leest precies alsof het taalmodel je baslijn heeft genalyseert, maar herhaalt enkel een patroon wat jij zelf als belangrijk hebt geintroduceert in de context van de huidige sessie.
En daar zijn we dan. Dat is het enige wat overblijft van je audio voordat je uberhaupt je 'feedback' krijgt.
Of de op een mening lijkende tekst die daar uit voortkomt waardevol is voor je hou ik buiten beschouwing. Hecht daar zoveel waarde aan als je wilt, maar snappen wat er intern werkt helpt tegen het magisch denken.
Ik heb een creatief beroep op hoog niveau en hanteer hele hoge standaarden voor intellectuele en creatieve diepgang en artistieke directie (in mijn werk) waar AI agents steeds meer aanwezig zijn).
Ik heb ook een creatief beroep op hoog niveau en hanteer hele hoge standaarden voor intellectuele en creatieve diepgang en artistieke directie (in mijn werk), maar hier word AI als onverantwoord gezien).