[tutorial 7.2026] Jak zrobić instrumental / acapella / 10 stem z dowolnego utworu [Ultimate Vocal Remover 5/Colab/MVSEP]

Dział przeznaczony dla osób zajmujących się produkowaniem muzyki. Porady, dyskusje oraz wskazówki techniczne.

Moderator: gonny_trebor

Nerwowy
Posty: 243
Rejestracja: 23 cze 2020, 17:31

Re: [tutorial 7.2026] Jak zrobić instrumental / acapella / 10 stem z dowolnego utworu [Ultimate Vocal Remover 5/Colab/MV

Post autor: Nerwowy »

@Luxair

1) UVR 5.6.1 Beta Roformer, a dokładnie dla Ciebie, to dokładniej patcha pod RTX 5000, bo inaczej nie działa akceleracja GPU (i dokładnie ta wersja działa poprawnie tylko na RTX 5000):
https://www.mediafire.com/file_premium/ ... 8.zip/file

* Dla wszystkich innych GPU niż RTX 5000 potrzeba tego:
https://github.com/Anjok07/ultimatevoca ... A_full.exe
A potem zainstalować:
https://github.com/TRvlvr/model_repo/re ... l_rofo.exe

Min. wspierane GPU w tych dwóch paczkach to:
GTX 750 (samo i Ti, najlepiej wariant 4GB)/od GTX 900 do RTX 4000/Intel bodaj Tiger Lake lub ARC, i na AMD dla Roformerów min. 4GB HD 7000 dla niższego chunk_size w pliku yaml np. 88200/112455/132300, inaczej będą błędy pamięci, ale niektóre modele z tak niskimi wartościami mają nieprawidłowy dźwięk (dopiero 12GB, może 10GB na AMD/Intel ARC nie wywala błędów bez zmiany chunk_size).
W razie błędu RuntimeError: "" na starych sterownikach podmień DirectML.dll na starsze 1.9.1.0 w katalogu torch_directml)

2) Jak już zainstalujesz UVR, wejdź w MDX-Net>Install model i pobierz ten ckpt i yaml, typ modelu w trakcie instalacji Mel albo BS-Roformer (nie v2) i wybierz oba pliki w trakcie procesu instalacji modelu.

3) Pobierz modele wokalowe:
https://huggingface.co/becruily/mel-ban ... /tree/main
(tak naprawdę, to model dwa w jednym, dający trzy stemy, jeden to inwersja, a pozostałe dwa, to wokale i instrumental,
dość zbalansowane, czasem ciut przymulone brzmienie)
Lub
https://huggingface.co/noblebarkrr/mvse ... nvuew.ckpt
https://huggingface.co/noblebarkrr/mvse ... onfig.yaml
(to najjaśniejszy z modeli wokalowych obecnie, ale w cichych fragmentach ma dużo szumu)

To raczej tyle, co potrzebujesz.
__________________________________________________________________________________________

W ramach ścisłości, wersja Beta Roformer ma już wbudowane DirectML, ale na NVIDII i tak używasz CUDA.
Stare wersje 5.6 nie wspierają jeszcze modelów typu Roformer w menu MDX-Net, które już są sporo lepsze od tamtych starszych typów modeli, ale wymagają sporo czasu do separacji, więc akceleracja GPU naprawdę mile widziana.
Na kartach AMD/Intel i 4GB trzeba będzie obniżyć chunk_size, na kartach NVIDIA zarządzanie pamięcią sprawia mniej problemów, i CUDA jest znacznie szybsza. UVR nie wspiera jeszcze ROCm na żadną generację AMD. Można użyć pymms-studio wtedy zamiast tego.

Sory, ale szybciej byś to zrobił na mvsep.com, czy szybciej też działa uvronline.app (ale nie ma bezstratnego formatu na wyjściu za darmowo).
Na MVSEP jest też fajny model BS-Roformer i PolarFormer oba 124 bands tylko dla Premium lub za free tam BS-Roformer 2025.07.

Albo na tym Colabie za free są też te modele co podawałem wyżej i wiele więcej:
https://colab.research.google.com/drive ... 4Ti9NnAdru

____

Inne dobre modele wokalowe:

BS-Roformer SW Vocals-Only (czyli ten z Logica)
Anvuew BS_RoFormer_mag (czyli v1)
unwa BS-Roformer-Leap Xe
HyperACE v2 voc (nie działa póki co w UVR)
Resurrection voc
Big Beta 6X, 7
Revive3e
Czasem jeszcze:
Gabox voc_fv7
vocfv7 beta 2, 3, 1
https://huggingface.co/GaboxR67/MelBandRoformers/
(nazwy powinny dać się wyszukiwać w repozytoriach trzech linków z HF, które wrzuciłem).

Dobre modele instrumentalowe:

BS-Roformer high instrum fullness 124 bands na MVSEP
Becruily Deux
Unwa bs_roformer_inst_HyperACEv2
Unwa BS-Roformer Resurrection inst
Unwa Mel-Roformer V1e+
Unwa BS-Roformer-HyperACE inst (czyli v1)
Gabox Mel-Roformer inst_gaboxFlowersV10
Inst_GaboxFv9
unwa BS-Roformer-Leap Xe instrumental
Gabox Inst_GaboxFv8
I mniej szumiące:
Inst_GaboxFv7z
Inst_FV8
I metoda z phase fixerem w Colabie (też da się w UVR - jest phase swapper w Tools):
https://colab.research.google.com/drive ... lZ5XcKMWXm

Więcej zdawkowych opisów modeli w pierwszym poście

4-6 stem:

BS-Roformer SW 6 stem (plus pianino i gitara)
https://huggingface.co/noblebarkrr/mvse ... fixed.ckpt
https://huggingface.co/noblebarkrr/mvse ... onfig.yaml
Demucs_ft (dostępny w UVR w menu pobierania modeli)
SCNet (lżejszy, raczej lepsze drumsy pod drumsep niż SW)
https://huggingface.co/Aname-Tommy/Huge ... /tree/main

Drumsep (do rozmiksu perkusji ze stemu drums z powyżej):

MVSEP 8 stems ensemble
MVSEP SCNet 4 stem
MVSEP SCNet 5 stem
MVSEP SCNet 6 stem model
Dostępne publicznie (w UVR):
jarredou MDX23C 5 stem model (nowszy, na ogół lepszy)
jarredou MDX23C 6 stem model (może lepiej doczyszczać)
Ostatnio zmieniony 03 paź 2026, 17:29 przez Nerwowy, łącznie zmieniany 7 razy.
Zrób sobie dobry instrumental/acapella/4+ ścieżki z dowolnego utworu - lipiec 2026 klik

Linki
Spoiler
Awatar użytkownika
Luxair
Posty: 6498
Rejestracja: 24 kwie 2019, 19:38

Re: [tutorial 7.2026] Jak zrobić instrumental / acapella / 10 stem z dowolnego utworu [Ultimate Vocal Remover 5/Colab/MV

Post autor: Luxair »

To raczej tyle, co potrzebujesz.
Dziękuję pan @Nerwowy, pobawię się niebawem!
You used to call me on my CVEL phone
Nerwowy
Posty: 243
Rejestracja: 23 cze 2020, 17:31

Re: [tutorial 7.2026] Jak zrobić instrumental / acapella / 10 stem z dowolnego utworu [Ultimate Vocal Remover 5/Colab/MV

Post autor: Nerwowy »

Dostałem na PW prośbę o pomoc w separacji dwóch nakładających się na siebie różnych wokali na siebie w kawałku (jeszcze nie harmonii).
Są modele, które to potrafią, ale który okaże się najlepszy będzie czasem zależało od utworu.

Można zacząć od modelu karaoke o nazwie Giant (3 stems), wpisując w wyszukiwarkę tutaj:
https://huggingface.co/spaces/noblebark ... s_zero_gpu

Lub modele poniżej także tutaj:
https://colab.research.google.com/drive ... KGVF9T5WsY
lub
https://colab.research.google.com/drive ... 4Ti9NnAdru
albo na MVSEP, możecie sprawdzić te modele do tego (ale nie wiem, czy są wszystkie):

Gabox Karaoke
Anvuew Karaoke
BS-Roformer Karaoke model by becruily & frazer
MVSEP’s BS Roformer by MVSep Team (tylko na MVSEP)
Gilliaan Karaoke

I jak się dalej nic nie uda:
Gilliaan deeffect
MVSep SATB Choir
MVSEP Multispeaker

MVSep DnR v3
HyperACE inst v2

Jeżeli któryś wyciągnie nawet nie ten wokal, co chciałeś, to potem przez zwykły model wokalowy, albo przepuszczając jeszcze raz przez któryś wyżej, wywali być może to, co trzeba, i po prostu dokleisz potem w DAW z powrotem ten stem wokalu, którego nie chciałeś wywalać, aczkolwiek może się przydarzyć, że rezultat nie będzie stały, tylko będą losowe przeciekania między stemami.

Jeśli w którymś fragmencie pojawia się czystą pętla wokalu, który się nie zapętla z resztą, a chcecie to usunąć, no to zwykły model wokalowy do ekstrakcji tego w jednym śladzie a potem inwersja pod każdy szczyt gdzie pojawia się pętla wzorując się na rezultacie z modelu wokalowego gdzie oba się nakładają powinno pomóc i część pików się łatwiej zgadzać na oko niż w pliku źródłowym, gdzie jest wszystko razem z muzyką.
Zrób sobie dobry instrumental/acapella/4+ ścieżki z dowolnego utworu - lipiec 2026 klik

Linki
Spoiler
ODPOWIEDZ