Голос собирается из одной или нескольких записей: система склеит их, уберёт тишину, выровняет громкость, выберет лучший отрезок речи до 15 секунд и расшифрует его. В готовый голос можно дозагрузить записи — образец пересоберётся.
Лучше 10–30 секунд чистой речи в сумме. Короткие голосовые склеятся сами.