# Dlaczego modele tworzą różne rankingi tych samych rzeczy

Te same oceny, inny zwycięzca. Sprawdzony przykład pokazuje wpływ wag i wzoru oraz granice porównywania modeli.

L00P.AI · 1.0 · 2026-09-26

https://www.l00p.ai/zasoby/serie/dlaczego-rankingi-modeli-sie-roznia/

## 01 / Dwie listy mogą odpowiadać na dwa pytania

Prosisz dwa modele o najlepsze projekty. Jeden wybiera przełomowe pomysły, drugi — te, które da się wykonać w tym roku. Oba przedstawiają uporządkowaną listę i przekonujące uzasadnienie. Zanim rozstrzygniesz, który model „wie więcej”, sprawdź, co każdy uznał za najlepsze.

Punktem wyjścia są dwa wewnętrzne opracowania porównawcze z 6 sierpnia 2026 r. oraz zapisane oceny z wcześniejszego dnia. Dotyczyły priorytetów badawczych. Zachowujemy lekcję metody, bez publikowania prywatnych rankingów. Nie jest to aktualny test jakości modeli ani ocena dzisiejszego stanu problemów naukowych. Nazwy modeli zapisane w archiwum nie stanowią tutaj zweryfikowanej specyfikacji usług.

## 02 / Ranking powstaje z kilku decyzji

Wynik zależy od listy kandydatów, definicji kryteriów, ocen, skali, wag i sposobu łączenia liczb. Do tego dochodzą źródła oraz data ich sprawdzenia. Dwie listy o podobnych nagłówkach mogą różnić się na każdym z tych poziomów.

Porównanie zacznij od wspólnego słownika: czy dwie nazwy oznaczają ten sam obiekt i ten sam zakres? Następnie ustal, czy kandydaci zostali ocenieni według jednakowej instrukcji. „Łatwe do wykonania” może oznaczać tydzień pracy małego zespołu albo szansę postępu w ciągu dekady. Wspólna skala od 0 do 10 nie naprawia takiej różnicy.

Jeżeli chcesz sprawdzić wyłącznie wpływ wzoru, zachowaj te same oceny i tę samą listę. Gdy zmieniasz wszystko naraz, widzisz różnicę wyników, lecz nie wiesz, co ją spowodowało.

## 03 / Neutralny przykład: przewaga o dwie dziesiąte

Przyjmijmy dwa fikcyjne projekty. A ma wartość 10, efekt naukowy 10 i osiągalność 1. B ma odpowiednio 8, 7 i 6. To umowne oceny dydaktyczne, nie pomiary ani prawdopodobieństwa. Dla ćwiczenia traktujemy różnice punktowe jako porównywalne.

Pierwsza reguła daje wartości wagę 40%, efektowi naukowemu 30%, a osiągalności 30%. Wagi sumują się do 100%:

- A: 0,40 × 10 + 0,30 × 10 + 0,30 × 1 = 7,3.
- B: 0,40 × 8 + 0,30 × 7 + 0,30 × 6 = 7,1.

A prowadzi o 0,2 punktu. Suma ważona pozwala wysokim ocenom w dwóch wymiarach zrównoważyć słabą osiągalność. To właściwość przyjętej reguły. Nie dowodzi, że projekt A uda się wykonać.

## 04 / Zmień tylko wagi

Przesuń 10 punktów procentowych z wartości do osiągalności. Nowe wagi wynoszą 30%, 30% i 40%; oceny projektów pozostają identyczne. A uzyskuje 6,4, a B — 6,9. Teraz B prowadzi o 0,5 punktu. Nie pojawił się żaden nowy fakt o projektach. Zmieniły się priorytety osoby układającej ranking.

![Te same oceny, trzy reguły. Wagi 40/30/30: A 7,3, B 7,1. Wagi 30/30/40: A 6,4, B 6,9. Średnia dwóch ocen razy osiągalność/10: A 1,0, B 4,5. Wszystkie dane fikcyjne.](https://www.l00p.ai/wydawnictwo/dlaczego-rankingi-modeli-sie-roznia/reguly-pl-v1.svg)

Autorski schemat liczbowy, Codex / L00P.AI. Wspólna skala 0–10; długość paska odpowiada wynikowi. Porównuj kolejność w obrębie reguły. To nie benchmark modeli.

Schemat pokazuje także drugi eksperyment, opisany w następnym rozdziale. Każdy pasek zaczyna się od zera, a pełna skala wynosi 10 punktów. [Pobierz dane i formuły CSV](/wydawnictwo/dlaczego-rankingi-modeli-sie-roznia/przyklad-v1.csv). Plik zawiera sześć wyników: dwa projekty i trzy reguły.

Nie wybieraj wag dopiero po zobaczeniu zwycięzcy. Ustal je z właścicielem decyzji, a potem pokaż, czy rozsądne alternatywy zmieniają kolejność. Jeśli zmieniają, wynik wymaga rozmowy o priorytetach, nie kolejnej cyfry po przecinku.

## 05 / Mnożenie zmienia rolę słabej oceny

W osobnym, uproszczonym wariancie liczymy średnią wartości i efektu naukowego, po czym mnożymy ją przez osiągalność podzieloną przez 10:

- A: ((10 + 10) / 2) × (1 / 10) = 1,0.
- B: ((8 + 7) / 2) × (6 / 10) = 4,5.

To nowa reguła, a nie zmiana samych wag poprzedniej sumy. Niska osiągalność ogranicza cały wynik; osiągalność równa zero wyzerowałaby go. Ten uproszczony wzór służy pokazaniu mechanizmu i nie odtwarza wszystkich składników historycznego rankingu. Porównuj kolejność wewnątrz każdej reguły, nie traktuj różnicy punktów między regułami jako zmierzonej straty wartości projektu.

[Podręcznik OECD/JRC](https://www.oecd.org/en/publications/handbook-on-constructing-composite-indicators-methodology-and-user-guide_9789264043466-en.html), w rozdziałach 1.6–1.7, zaleca jawne uzasadnienie wag, agregacji i analizy wrażliwości. Omawia też możliwość kompensowania słabości jednego wymiaru przewagą w innym. Jeśli warunek jest bezwzględny, najpierw zastosuj [kryterium dopuszczenia](/zasoby/serie/jak-wybierac-system-do-dzialajacej-organizacji/), zamiast liczyć, że sam wzór go ochroni.

## 06 / Co trzeba skorygować w historycznym porównaniu

Źródłowa analiza trafnie pokazywała różnicę między dodawaniem i mnożeniem ocen, lecz zbyt stanowczo przypisywała rozbieżność samemu wzorowi. Odczytane dane pokazują również inne oceny i inne zbiory kandydatów. Bez wspólnej podstawy nie da się podać, jaka część zmiany kolejności wynikała z metody.

Przeliczenie zapisanych składników nie odtworzyło dokładnie wszystkich zapisanych wyników. Nie rozstrzygamy bez dodatkowych danych, czy przyczyną były zaokrąglenia, inne wejścia czy błąd. Archiwum pozostało niezmienione. Publiczny przykład ma własne, kompletne dane i sprawdzony rachunek.

Druga korekta dotyczy nazwy „ROI”. Punktowy wskaźnik nie staje się finansowym zwrotem z inwestycji przez samo nazwanie go w ten sposób. Ocena 1/10 nie jest automatycznie szansą powodzenia 10%. Do takiej interpretacji potrzebna byłaby uzasadniona kalibracja; tutaj jej nie ma. Nie przepisujemy też pochwał autora własnego porównania jako niezależnej recenzji.

## 07 / Poproś o dane, nie tylko werdykt

Użyteczne zlecenie dla modeli powinno ustalać wspólną listę, znaczenie kryteriów, datę źródeł, sposób traktowania braków oraz format ocen. Ocenę nieustaloną oznacz jako brak z powodem; nie zastępuj jej zerem. Oddziel ocenianie kandydatów od liczenia: prosty skrypt może policzyć ten sam wzór dla wszystkich.

Sprawdź osobno: inne wagi przy tych samych danych, inne oceny przy tym samym wzorze oraz wpływ dołączenia lub usunięcia kandydatów. Remisy pokaż jawnie. Zapisz, które wnioski pozostają stabilne, a które zależą od założeń. Poprawna arytmetyka nie potwierdza trafności ocen.

Do rozmowy wystarczy jedna decyzja i dwa warianty. Możemy pomóc ustalić wspólną podstawę porównania, zachowując prywatność danych projektu. Celem jest decyzja, którą da się wyjaśnić, a nie tabela, w której zawsze wygrywa ulubiony produkt.

## 08 / Źródła, liczby i udział SI

Przeczytano oba historyczne opracowania, tabelę ocen oraz pola liczbowe zbioru maszynowego. Weryfikacja z 26 września 2026 r. obejmuje rachunki i metodę, nie pełny ponowny audyt dawnych tez naukowych. Podręcznik OECD/JRC pochodzi z 2008 r.; sprawdzono wskazane rozdziały, nie przedstawiamy go jako nowej publikacji.

Codex przygotował tekst PL/EN, CSV i deterministyczny SVG. Wszystkie sześć wyników przykładu przeliczono. Nie użyto cudzych ilustracji, nie wykonano nowego benchmarku modeli ani niezależnej recenzji drugiego modelu. Człowiek może wycofać materiał po publikacji. Błąd rachunku, nowe dane źródłowe lub zmiana metody wymagają nowego odbioru i jawnej wersji.
