Das Audio realisiert hauptsächlich die folgenden Funktionen: A: Extrahieren der Hüllkurve des Audios, das Erkennen der Lautstärke ist zu groß, zu klein und die Abhörerkennungsfunktion; B, Vergleichen der Energiewerte vor und nach der Audiopause, um die Tonerkennungsfunktion zu realisieren; In C wird die Audiokurvenanpassung erster Ordnung mit dem Lautstärkewert am Anfang und am Ende durchgeführt, um die Neigung und den vertikalen Versatz der angepassten geraden Linie zu erhalten, um so die Erfassungsfunktion des Fade- Ein- und Ausblendeffekt; D. Das typische aktuelle Klangspektrum hat offensichtliche helle Linien. Durch Berechnung der Audioenergie und des entsprechenden Varianzwerts wird diese Eigenschaft analysiert, um die Funktion der aktuellen Geräuscherkennung zu realisieren. Die Erfindung hat die Vorteile, dass das Verfahren zum Herausziehen der Hülle angewendet wird und die Genauigkeit der Volumenerfassung weiter verbessert wird; Die Erfassung des Ein- und Ausblendens wird gut durchgeführt und die Genauigkeit ist hoch. Die Methode hat einen guten Erkennungseffekt für den spezifischen aktuellen Klang.
Mit der kontinuierlichen Verbesserung der Lebensqualität moderner Menschen wird das Streben nach Musikqualität immer wichtiger. Qualitativ hochwertige MP3s, verlustfreie Musikformate und ähnliches, Musikbewertungsseiten und Software sind auch zunehmend im täglichen Leben der Menschen involviert. In einer großen Anzahl von Musikmusikbibliotheken ist die Audioqualität jedoch nicht einheitlich, und die manuelle Erkennung der Klangqualität erfordert viel Arbeit und ist nicht nachhaltig. Daher ist eine gute Maßnahme erforderlich, um dieses Problem zu lösen.
Bei der Methode zur Erkennung von Audio-Features beeinflussen diese Features die auditive Wirkung des Publikums in gewissem Umfang und stellen somit eine bestimmte Referenz für die künstliche Erkennung der Klangqualität bereit. Durch diese Methode können die Audiofunktionen automatisch erkannt werden, die enorme Arbeitsbelastung und das Personalrisiko der manuellen Erkennung werden reduziert und die Erkennungseffizienz wird effektiv verbessert. Gleichzeitig kann die durch menschliche Faktoren verursachte charakteristische Falscherkennungsrate reduziert werden, und die Genauigkeit der Detektion wird weiter sichergestellt.
Die Extraktion von Audiofunktionen analysiert dann die Wirksamkeit und Robustheit dieser Funktionen, um verschiedene Audiotypen von zwei Aspekten zu unterscheiden. Basierend auf diesen Funktionen wird ein Support Vector Machine (SVM) -Klassifizierer zum Trainieren und Testen eines Audiodatensatzes von ungefähr 5 Stunden verwendet, wobei der Ton in fünf vordefinierte Kategorien unterteilt wird: Stummschaltung, reine Sprache, unreine Sprache, Musik und Umgebungslicht klingen. Experimentelle Ergebnisse zeigen, dass es möglich ist, Audioszenen mit effektiven Audiofunktionen in verschiedene Arten zu klassifizieren.




