Résumé
Notre objectif est de revisiter les approches traditionnelles [3, 18] pour restaurer les signaux audio et améliorer la qualité audio en utilisant des méthodes récentes d'apprentissage profond telles que les U-net conditionnels [19]. En outre, nous proposerons de nouvelles méthodes d'inversion ou d'annulation des effets basées sur des modèles [12]. À cette fin, nous visons à inverser le processus de mixage et/ou les effets ciblés dans des contextes de diffusion réels. Ainsi, le projet AQUA-RIUS étendra le travail prometteur basé sur l'ingénierie inverse des mixages de studio et de DJ [26] en considérant des configurations plus complexes telles que celles impliquant des effets non-linéaires, des pistes inconnues ou partiellement connues utilisées pendant la session de mixage, et des effets de décalage temporel non-constants. I) Augmentation des données Dans les applications d'apprentissage automatique, le nombre et la diversité des exemples d'entraînement sont essentiels pour la généralisation et la robustesse du traitement. Malheureusement, la constitution d'un ensemble de données d'entraînement est une tâche difficile et fastidieuse. Le rôle initial de l'augmentation des données [30] est d'appliquer des transformations sur les exemples d'entraînement pour augmenter artificiellement la taille de l'ensemble d'apprentissage et améliorer les performances du traitement [5, 32]. Cette approche a été utilisée avec succès dans un grand nombre d'applications audio telles que [23, 6]. Il est clairement démontré que l'application d'une chaîne appropriée de transformations et de dégradations audio sur l'ensemble de données d'apprentissage peut améliorer de manière significative les résultats lorsque les exemples testés sont eux-mêmes transformés, comme le montre [20]. L'objectif de cette tâche est d'étendre ce travail basé sur l'augmentation des données lorsqu'elles sont utilisées pour des applications audio. Pour cette recherche, nous utiliserons la boîte à outils de simulation directe pour les transformations, les dégradations et le mixage audio. L'étude des propriétés d'invariance peut notamment être réalisée dans ce contexte, car la plupart des applications MIR visent à être robustes à un grand nombre d'effets audio liés à la qualité audio (par exemple, l'effet de l'artiste ou de l'album [15]). L'invariance est liée à la capacité des caractéristiques et/ou des valeurs estimées à être faiblement affectées par une transformation donnée. Pour le traitement audio, il est intéressant de voir comment la qualité audio peut être modifiée pour obtenir des résultats meilleurs et plus robustes, et donc quelles transformations peuvent être utilisées ou non. Par exemple, comme indiqué dans [20] et contrairement à ce que nous pourrions attendre, l'application de transformations pour lesquelles l'étiquette prédite semble être invariante peut améliorer la robustesse. En outre, l'augmentation des données est une piste intéressante pour réduire le risque de surapprentissage (horse effect), voir par exemple [27, 28, 17]. Pour certains ensembles de données d'apprentissage, de classification par exemple, les étiquettes prédites peuvent être corrélées à une propriété indésirable des exemples annotés, ce qui peut donner de bons résultats illusoires lorsque les exemples de test ont les mêmes corrélations. Ce problème est souvent rencontré dans un scénario d'ensemble de données croisé, ou avec des signaux de faible qualité. Dans ce cas, l'utilisation de l'augmentation des données diversifie les propriétés sonores de l'ensemble de données d'apprentissage et rend possible sa décorrélation avec les étiquettes afin d'améliorer la robustesse et la performance dans un cas réel. Toutefois, les transformations utilisées doivent être soigneusement sélectionnées de manière à ce que les propriétés sonores qui caractérisent réellement les étiquettes restent inchangées. II) Modèles génératifs Notre objectif est d'explorer la simulation et l'inversion de la qualité audio à l'aide de modèles génératifs basés sur des réseaux neuronaux profonds. Parmi les approches proposées, nous proposons d'étudier les autoencodeurs variationnels (VAE) [22], les réseaux adversaires génératifs (GAN) [10] et son adaptation CycleGAN [33] qui sont intensivement utilisés dans une grande variété d'applications de vision par ordinateur. Ici, nous pensons qu'ils peuvent également être utilisés pour simuler des signaux réalistes avec une qualité audio ciblée tout en obtenant une représentation latente permettant un contrôle possible de la qualité audio et une inversion. La littérature propose plusieurs études basées sur des architectures d'apprentissage profond génératif pour générer de la musique à partir d'une représentation latente contrainte [13]. Ces approches pourraient être adaptées pour tenir compte de la qualité audio et simuler, par exemple, des effets de studio ou des effets artistiques intéressants. Le démêlage des informations saillantes véhiculées par les VAE peut alors être obtenu en utilisant, par exemple, une fonction de perte contradictoire telle que proposée précédemment par les réseaux Fader appliqués à la vision par ordinateur [16]. Une autre idée est l'utilisation d'un modèle génératif tel que proposé dans [4] pour l'empoisonnement inverse qui a montré son efficacité pour améliorer la robustesse et l'efficacité des architectures de réseaux neuronaux profonds classiques entraînés en utilisant le même ensemble de données d'évaluation. Ainsi, cette tâche proposera d'adapter de telles approches aux méthodes de classification audio existantes. La simulation de la qualité audio est intéressante pour la production musicale en tant qu'effet créatif pour transmettre une atmosphère souhaitée (par exemple, vintage, chaude, creuse, ronde ou distante). III) Restauration du signal, démixage et remixage de la musique Dans cette tâche, nous proposons d'étudier en détail l'inversion des effets audio et des dégradations sonores. L'objectif est de restaurer un signal avec sa qualité audio originale avant transformation. Ce sujet présente de nombreux intérêts tels que la suppression des défauts et du bruit [3] des fichiers audio altérés ou endommagés. Il est également intéressant d'annuler les altérations d'un effet audio spécifique pour revenir à la version originale et brute [8, 11]. Dans un premier temps, nous proposons une approche classique basée sur l'inversion ou l'annulation d'un effet par le biais d'une modélisation mathématique. Ensuite, nous aborderons ce problème grâce aux approches d'apprentissage profond qui peuvent être utilisées pour approximer [7] et/ou inverser un opérateur d'effet arbitraire en utilisant par exemple une architecture neuronale spécifique [9]. Nous proposons également d'étendre nos recherches antérieures sur l'ingénierie inverse des mixages de studio et de DJ [26], en considérant des configurations de mixage plus compliquées telles que : (1) impliquant des effets non linéaires, (2) des pistes inconnues ou partiellement connues utilisées pendant la session de mixage, (3) mise à l'échelle temporelle non constante : ici, une approche itérative d'analyse par synthèse peut permettre d'approcher les variations temporelles appliquées. de s'approcher très précisément des changements de vitesse variables dans le temps, ce qui permet d'améliorer les performances des méthodes de mixage inversé pour les DJ. méthodes de mixage DJ inversé. Cela est également utile pour la tâche de génération d'ensembles de données, car les pistes non mixées isolées d'un mixage de DJ peuvent inclure des transformations de diffusion (EQ, EQ, etc.)qui peuvent être utiles pour une comparaison avec les pistes d'origine [25]. Suite à la simulation précédente et aux tâches d'inversion, une application intéressante est le remixage d'un enregistrement. Cette tâche est consacrée à la transformation sonore d'un morceau de musique afin de changer son style de mixage. Par exemple, dans le cas d'une musique récente mixée dans un style moderne, l'inversion des effets permet d'obtenir une version neutre qui peut ensuite être remixée dans un style différent, par exemple à la mode des années 60. D'une part, la création automatique d'une application de re-mixage présente un grand avantage pour l'augmentation des données, pour de nombreuses tâches de reconnaissance qui sont insensibles à la qualité audio (par exemple, la transcription automatique, la reconnaissance d'instruments, les analyses de rythme) [21].