Jak funguje AI generování hudby
Napíšete větu, za tři minuty hraje hotová písnička se zpěvem. Vypadá to jako kouzlo, ale je to „jen“ statistika v obřím měřítku. Tady je srozumitelné vysvětlení, co se mezi vaším zadáním a hotovou skladbou doopravdy děje.
Model se naučil, jak hudba „chodí“
AI hudební model prošel tréninkem na obrovském množství nahrávek. Nenaučil se skladby nazpaměť — naučil se vzorce: jak po sobě jdou akordy v popu, jak zní rocková bicí souprava, jak se frázuje zpěv v baladě, kdy přichází refrén. Podobně jako člověk, který poslouchal hudbu celý život, „ví“, co v písničce obvykle následuje — jen to ví v miliardách parametrů.
Od textu k hudbě: dva kroky
Moderní nástroje pracují ve dvou fázích. Nejdřív jazykový model napíše text písně — sloky, refrén, rýmy. Pak hudební model dostane text plus popis stylu („energický pop, ženský vokál, 120 BPM“) a generuje samotný zvuk: kousek po kousku skládá zvukovou stopu tak, aby odpovídala žánru, textu a náladě. Zpěv přitom nevzniká tak, že by „robot četl text“ — model generuje zpěv jako součást hudby, včetně frázování, dechu a emocí.
Proč každý pokus zní jinak
Generování je záměrně trochu náhodné — model si v každém kroku vybírá z více pravděpodobných pokračování. Proto dvě generace ze stejného zadání zní různě a proto se vyplatí mít víc pokusů: nehledáte „správný“ výsledek, ale ten, který vám sedne nejvíc. Je to spíš casting než výroba na běžícím pásu.
Proč je čeština těžší než angličtina
Modely viděly v tréninku řádově víc anglické hudby. Čeština má navíc pevný přízvuk na první slabice a délky samohlásek, které nesmíte ve zpěvu rozbít, jinak zní text komicky. Nástroje stavěné pro češtinu proto ladí obě fáze — český text s správným rytmem i výslovnost ve zpěvu. Přesně to je přístup MakeSong.cz.
Vyzkoušejte to na vlastní uši
Nejlepší vysvětlení je vlastní zkušenost: na makesong.cz si po bezplatné registraci vygenerujete první českou písničku zdarma. Napište do chatu nápad a poslechněte si, co z těch miliard parametrů vyleze.