Een LLM kan geen muziek analyseren [Experiment, los van ethiek]

Dit is wat een Claude model antwoord als je vraagt wat er kan qua audio analyse. Volgens mij een geloofwaardig en redelijk inhoudelijk antwoord:

Eerlijk gezegd kan ik geen audio beluisteren — ik kan geen mp3/wav-bestanden afspelen of "horen". Wat wél werkt:

- **Screenshots van een spectrogram of waveform** (bijv. uit Ableton, iZotope, of een tool als Spectral Analyzer) — daar kan ik wél naar kijken en dingen zeggen over frequentiebalans, dynamiek, stereobeeld, maskering, etc.
- **Tekstuele data**: als je export van loudness-meters (LUFS, true peak), EQ-curves, of een tracklist met BPM/toonsoort deelt, kan ik daarmee analyseren en adviseren.
- **Project-structuur**: als je een Ableton-projectbestand of stemsoverzicht deelt (welke tracks, plugins, routing), kan ik daar strategisch naar kijken.

Kortom: geen directe audio-analyse, maar met een spectrogram-screenshot of je eigen luisterindruk kom ik een heel eind. Wil je dat aanpakken voor een specifieke track?
 
Smaak is niet moeilijk in regels te vangen, het is onmogelijk.
Je hebt gelijk dat smaak als ervaring ongrijpbaar is, maar onderschat niet dat ons brein een fysiek, voorspelbaar orgaan is. Als het brein een patroon is, dan kan een ander patroon (AI) dat patroon leren nabootsen. De regels bestaan niet, maar de statistieken wel.
 
Het kwalijke (niet op ethisch vlak daarom, maar misleidend voor de gebruiker) is niet dat hij geen smaak heeft of geen audio kan analyseren, maar dat hij doet alsof hij wel de audio heeft geanalyseerd. Daar was Claude dan gelukkig duidelijker in.
 
Dit is wat een Claude model antwoord als je vraagt wat er kan qua audio analyse. Volgens mij een geloofwaardig en redelijk inhoudelijk antwoord:

Eerlijk gezegd kan ik geen audio beluisteren — ik kan geen mp3/wav-bestanden afspelen of "horen". Wat wél werkt:

- **Screenshots van een spectrogram of waveform** (bijv. uit Ableton, iZotope, of een tool als Spectral Analyzer) — daar kan ik wél naar kijken en dingen zeggen over frequentiebalans, dynamiek, stereobeeld, maskering, etc.
- **Tekstuele data**: als je export van loudness-meters (LUFS, true peak), EQ-curves, of een tracklist met BPM/toonsoort deelt, kan ik daarmee analyseren en adviseren.
- **Project-structuur**: als je een Ableton-projectbestand of stemsoverzicht deelt (welke tracks, plugins, routing), kan ik daar strategisch naar kijken.

Kortom: geen directe audio-analyse, maar met een spectrogram-screenshot of je eigen luisterindruk kom ik een heel eind. Wil je dat aanpakken voor een specifieke track?

Dit is een andere strikte beperking van een taalmodel wat vele mensen maar niet lijken te begrijpen: Je kunt een taalmodel niet vragen naar de beperkingen van dat taalmodel, net zoals je een taalmodel niet kan vragen hoe het taalmodel tot een antwoord is gekomen. Dat zijn per definitie hallucinaties, zo werkt de technologie gewoonweg niet. Dit is heel belangrijk om te weten, want het antwoord wat een taalmodel genereert gaat alsnog klinken alsof het dat wel kan. Zelfs als het kan (wat niet kan), zou het taalmodel al vergeten zijn hoe het vorige stuk tekst tot stand kwam zodra je vraagt hoe het er toe kwam.

Precies hetzelfde probleem als mensen die een taalmodel voor muziek feedback gebruiken. Een fundamenteel gebrek aan kennis van de technologie, waardoor logisch klinkende antwoorden als correct worden ervaren met magisch denken over hoe het werkt. Taalmodellen produceren vrijwel altijd geloofwaardige en redelijk inhoudelijk klinkende testen - Dat is letterlijk waar de technologie voor gemaakt is. Dat heeft niks te maken met het antwoord op je vraag, enkel dat het klinkt als het antwoord op je vraag.

ons brein een fysiek, voorspelbaar orgaan is
Dat is een aanname die niet wetenschappelijk is bewezen, alle wetenschap die ik ken daarover heeft dit afgewezen. Hoe informatie binnenkomt en word verwerkt grotendeels, hoe mensen daarop reageren niet. Laten we het bij de feiten houden.
 
Laatst gewijzigd:
Het kwalijke (niet op ethisch vlak daarom, maar misleidend voor de gebruiker) is niet dat hij geen smaak heeft of geen audio kan analyseren, maar dat hij doet alsof hij wel de audio heeft geanalyseerd. Daar was Claude dan gelukkig duidelijker in.
Het is in ieder geval iets! ChatGPT genereerde ook eens zo'n antwoord toen ik probeerde om muzikale feedback op een excel bestand te krijgen. Dit is wat ChatGPT genereert op zo'n prompt.


Yes. If you upload a music audio file (or several), I can analyze it in a variety of ways, including:


  • Musical structure: intro, verse, chorus, bridge, outro, transitions.
  • Harmony: key, chord progression (approximate by ear), modulations, harmonic complexity.
  • Melody: contour, motifs, memorable hooks, vocal or instrumental lines.
  • Rhythm: tempo (BPM estimate), time signature, groove, syncopation, swing.
  • Instrumentation: identify likely instruments, arrangement, orchestration, layering.
  • Production: mix balance, EQ, compression, stereo image, reverb, effects, loudness, dynamics.
  • Genre and influences: likely genres, stylistic influences, similar artists or eras.
  • Performance: vocal delivery, timing, expressiveness, instrumental technique.
  • Songwriting: strengths, weaknesses, emotional impact, commercial appeal.
  • Mastering feedback: clipping, dynamic range, tonal balance, perceived loudness.
  • Comparisons: compare two mixes, two masters, or two performances and explain the differences.
  • Transcription (limited): estimate chords, identify riffs, suggest scales, and transcribe short melodic passages.

Nogmaals voor de goede herhaling: Een LLM kan per definitie niet uitleggen wat het er in het interne process gebeurd of wat de limitaties zijn.
 
Dit is een andere strikte beperking van een taalmodel wat vele mensen maar niet lijken te begrijpen: Je kunt een taalmodel niet vragen naar de beperkingen van dat taalmodel, net zoals je een taalmodel niet kan vragen hoe het taalmodel tot een antwoord is gekomen. Dat zijn per definitie hallucinaties, zo werkt de technologie gewoonweg niet. Dit is heel belangrijk om te weten, want het antwoord wat een taalmodel genereert gaat alsnog klinken alsof het dat wel kan. Zelfs als het kan (wat niet kan), zou het taalmodel al vergeten zijn hoe het vorige stuk tekst tot stand kwam zodra je vraagt hoe het er toe kwam.

Precies hetzelfde probleem als mensen die een taalmodel voor muziek feedback gebruiken. Een fundamenteel gebrek aan kennis van de technologie, waardoor logisch klinkende antwoorden als correct worden ervaren met magisch denken over hoe het werkt. Taalmodellen produceren vrijwel altijd geloofwaardige en redelijk inhoudelijk klinkende testen - Dat is letterlijk waar de technologie voor gemaakt is. Dat heeft niks te maken met het antwoord op je vraag, enkel dat het klinkt als het antwoord op je vraag.


Dat is een aanname die niet wetenschappelijk is bewezen, alle wetenschap die ik ken daarover heeft dit afgewezen. Hoe informatie binnenkomt en word verwerkt grotendeels, hoe mensen daarop reageren niet. Laten we het bij de feiten houden.
Een beetje kort door de bocht. Het is natuurlijk zo dat een model geen echt begrip heeft van de eigen beperkingen en dat dit vaak tot hallucinaties leidt. Maar als je gelezen had wat ik gepost had dan zie je dat het model correct aangeeft dat het GEEN analyse kan doen op muziek. Precies het punt dat je zelf steeds maakt? Ik denk dat het model deze correcte informatie gewoon uit de trainingsdata gehaald heeft.
De rest van het antwoord van het model kan en wil ik ook niet verifieren, maar de belangrijkste constatering uit het antwoord is gewoon juist en geen hallucinatie.
 
Toen ChatGPT nog erg jong was, versie 1 of 2, heb ik hem gevraagd of hij Doom kon draaien. Toen zij Chatzie dat hij als LMM dat niet kon, om vervolgens wat lijntjes vol te typen over de will it run doom meme en hoe ieder apparaat waarop je chatgpt kan gebruiken waarschijnlijk wel meer dan krachtig genoeg is. Maar goed, toen koen hij dus wel gewoon zeggen "ik kan dit niet".

Als je Claude vraagt om een afbeelding te maken, zegt hij ook duidelijk en terecht "ik kan dit niet". Als je hem vraagt om een afbeelding te analyseren, kan hij dit wel. Soms handig om iets te identificeren.
 
Een beetje kort door de bocht. Het is natuurlijk zo dat een model geen echt begrip heeft van de eigen beperkingen en dat dit vaak tot hallucinaties leidt. Maar als je gelezen had wat ik gepost had dan zie je dat het model correct aangeeft dat het GEEN analyse kan doen op muziek. Precies het punt dat je zelf steeds maakt? Ik denk dat het model deze correcte informatie gewoon uit de trainingsdata gehaald heeft.
De rest van het antwoord van het model kan en wil ik ook niet verifieren, maar de belangrijkste constatering uit het antwoord is gewoon juist en geen hallucinatie.

Dat is waar, dat zit waarschijnlijk wel in de trainingsdata. Met Claude heb ik wat minder ervaring, al maakt het natuurlijk niet uit of het antwoord goed of niet is als mijn (incorrecte) aanname ging over de hoe. Grappig hoe fout dat gaat bij ChatGPT in vergelijking, Claude kan tenminste de uitkomst van een een aantal getallen door audioanalyse (bpm, frequenties) en daar weer wat bij halen (al dacht 'ie nog steeds dat mijn ambient freeform pads track 219 bpm "it matches the bpm you gave me" mogelijk vanwege de titel (of toevallig, kan even goed)).

Ondertussen bij Google AI:
Nee, in het Nederlandse woord onderbroken zit het Engelse woord broken niet verstopt.
 
Laatst gewijzigd:
Back
Top