Detail výsledku

How To Improve Your Speaker Embeddings Extractor in Generic Toolkits

ZEINALI, H.; BURGET, L.; ROHDIN, J.; STAFYLAKIS, T.; ČERNOCKÝ, J. How To Improve Your Speaker Embeddings Extractor in Generic Toolkits. In Proceedings of 2019 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH AND SIGNAL PROCESSING (ICASSP). Brighton: IEEE Signal Processing Society, 2019. p. 6141-6145. ISBN: 978-1-5386-4658-8.

Typ

článek ve sborníku konference

Jazyk

anglicky

Autoři

Zeinali Hossein, Ph.D., UPGM (FIT)
Burget Lukáš, doc. Ing., Ph.D., UPGM (FIT)
Rohdin Johan Andréas, M.Sc., Ph.D., FIT (FIT), UPGM (FIT)
Stafylakis Themos
Černocký Jan, prof. Dr. Ing., UPGM (FIT)

Abstrakt

Recently, speaker embeddings extracted with deep neural networksbecame the state-of-the-art method for speaker verification. In thispaper we aim to facilitate its implementation on a more generictoolkit than Kaldi, which we anticipate to enable further improvementson the method. We examine several tricks in training, suchas the effects of normalizing input features and pooled statistics, differentmethods for preventing overfitting as well as alternative nonlinearitiesthat can be used instead of Rectifier Linear Units. In addition,we investigate the difference in performance between TDNNand CNN, and between two types of attention mechanism. Experimentalresults on Speaker in the Wild, SRE 2016 and SRE 2018datasets demonstrate the effectiveness of the proposed implementation.

Klíčová slova

Deep neural network, speaker embedding, xvector,Tensorflow, Kaldi.

URL

Rok

2019

Strany

6141–6145

Sborník

Proceedings of 2019 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH AND SIGNAL PROCESSING (ICASSP)

Konference

2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

ISBN

978-1-5386-4658-8

Vydavatel

IEEE Signal Processing Society

Místo

Brighton

DOI

10.1109/ICASSP.2019.8683445

UT WoS

000482554006074

EID Scopus

2-s2.0-85068991245

BibTeX

@inproceedings{BUT158087,
  author="Hossein {Zeinali} and Lukáš {Burget} and Johan Andréas {Rohdin} and Themos {Stafylakis} and Jan {Černocký}",
  title="How To Improve Your Speaker Embeddings Extractor in Generic Toolkits",
  booktitle="Proceedings of 2019 IEEE INTERNATIONAL CONFERENCE ON ACOUSTICS, SPEECH AND SIGNAL PROCESSING (ICASSP)",
  year="2019",
  pages="6141--6145",
  publisher="IEEE Signal Processing Society",
  address="Brighton",
  doi="10.1109/ICASSP.2019.8683445",
  isbn="978-1-5386-4658-8",
  url="https://ieeexplore.ieee.org/abstract/document/8683445"
}

Soubory

pdf zeinali_icassp2019_0006141.pdf 197 kB

Projekty

Dolování infoRmAcí z řeči Pořízené vzdÁlenými miKrofony, MV, Bezpečnostní výzkum České republiky 2015-2020, VI20152020025, zahájení: 2015-10-01, ukončení: 2020-09-30, ukončen
IT4Innovations excellence in science, MŠMT, Národní program udržitelnosti II, LQ1602, zahájení: 2016-01-01, ukončení: 2020-12-31, ukončen
Mezinárodní mobilita výzkumníků Vysokého učení technického v Brně, EU, OPVVV PO2 Mezinárodní mobilita výzkumných pracovníků, EF16_027/0008371, CZ.02.2.69/0.0/0.0/16_027/0008371, zahájení: 2018-01-01, ukončení: 2022-09-30, řešení
Neuronové sítě shrnující sekvence pro rozpoznávání mluvčího, EU, Horizon 2020, 5SA15094, zahájení: 2016-07-01, ukončení: 2019-06-30, ukončen
Zpracování, zobrazování a analýza multimediálních a 3D dat, VUT, Vnitřní projekty VUT, FIT-S-17-3984, zahájení: 2017-03-01, ukončení: 2020-02-29, ukončen

Výzkumné skupiny

Výzkumná skupina dolování dat z řeči BUT Speech@FIT (VZ SPEECH)

Pracoviště

Ústav počítačové grafiky a multimédií (UPGM)