Wynik mówi więcej.
Modele mierzymy tą samą miarą. Prosta metoda też może wygrać.
Wczytywanie Ligi modeli…
Nowe prognozy Chronos-2.
Nowe prognozy dla sześciu walut, trzech paliw i inflacji. Po publikacji odczytu porównamy siedem metod na wspólnych celach. Ten rejestr zaczyna się od nowych zapisów; wcześniejszy test historyczny jest poniżej.
Wczytywanie rejestru…
Jak kwalifikujemy i porównujemy prognozy?
Sześć metod zachowuje oryginalne prognozy z paszportu PRO. Chronos dostaje tę samą wersję i dokładny zakres danych. Wystawiamy nowy, osobny zapis. Oba zapisy muszą spełniać warunki LIVE. Liczymy tylko komplet siedmiu metod; dla tego samego początku i daty celu wybieramy pierwszy kwalifikujący się zapis.
Waluty wymagają wystawienia w dniu najnowszych danych NBP. Paliwa wymagają przyszłego, dokładnego tygodnia. Dla CPI oceniamy każdy horyzont osobno, przed pierwszym odczytem GUS; rozliczamy go dopiero potwierdzoną pełną publikacją. Późniejsza rewizja nie zmienia pierwszego wyniku.
Przypięty Chronos-2 działa bez dostrajania i bez łączenia serii. Wyniki nie trafiają do głównego rankingu sześciu metod. Krótka próba oraz nakładające się cele nie wystarczają do stwierdzenia przewagi. Zapis zawiera SHA-256, ale nie ma niezależnego znacznika czasu.
Sprawdzamy Chronos-2.
Model Amazon porównany z sześcioma obecnymi metodami na tych samych danych i terminach. To osobny test historyczny; jego wyniki nie trafiają do Ligi LIVE.
Liczba wygranych porównań nie jest procentową skutecznością. Krótki test nie potwierdza trwałej przewagi.
| Horyzont | Chronos-2, gr ↓ | Ostatnia wartość, gr | Najlepsza obecna metoda, gr | Zmniejszenie MAE wobec ostatniej wartości |
|---|---|---|---|---|
| 1 publ. | 0,718 | 0,636 | 0,636Ostatnia wartość | -12,9% |
| 5 publ. | 1,407 | 1,421 | 1,307Prognoza łączona | +1,0% |
| 20 publ. | 2,398 | 1,613 | 1,593Automatyczny wybór | -48,7% |
MAE to średni błąd bezwzględny — mniej znaczy lepiej. W ostatniej kolumnie wynik dodatni oznacza mniejszy błąd, ujemny większy. Najlepszą obecną metodę wskazano po porównaniu wyników tej próby.
Przedziały, sposób testowania i ograniczenia
Każda prognoza otrzymała wyłącznie wcześniejszy fragment historii, bez wspólnego przetwarzania różnych początków prognoz. Nie dostrajaliśmy modelu. Punkt prognozy to mediana; przedział tworzą kwantyle 0,1 i 0,9.
| Horyzont | Pokrycie zakresu nominalnego 80% | Średnia szerokość, gr |
|---|---|---|
| 1 publ. | 18 / 20 (90%) | 2,264 |
| 5 publ. | 16 / 20 (80%) | 4,361 |
| 20 publ. | 20 / 20 (100%) | 9,441 |
Zakresy są surowym wynikiem modelu, bez kalibracji na danych lokalnych. Nominalne 80% nie gwarantuje takiego pokrycia. Dane historyczne zawierają obecnie dostępne rewizje, a nakładające się cele nie są niezależnymi próbami. Nie możemy wykluczyć, że część historii występowała w danych użytych wcześniej do trenowania Chronos-2.
Pełny test trwał 26,5 s na CPU i zużył maksymalnie 821 MiB pamięci procesu. To pomiar jednego przebiegu na naszym serwerze. Protokół porównawczy: pro-v2.