Przejdź do treści
Danaco LEX

Dokumentacja

Metodyka wyszukiwania

Wyszukiwanie idzie dwiema drogami naraz — po słowach i po znaczeniu — a wyniki są scalane jednym rankingiem. Ten dokument opisuje, dlaczego tak, i co z tego wynika dla trafności.

Dwie warstwy wyszukiwania

Pytanie zadane po polsku rzadko zawiera te słowa, których użył sąd w uzasadnieniu. Pytasz o „karę za spóźnioną dostawę", a orzeczenie mówi o „karze umownej za zwłokę w wykonaniu zobowiązania". Sama wyszukiwarka słów tego nie połączy.

Dlatego każde zapytanie idzie równolegle dwiema drogami: dosłowną i znaczeniową. Wyniki obu są następnie scalane w jeden ranking.

Warstwa pełnotekstowa

Indeks pełnotekstowy obejmuje orzeczenia, przepisy, komentarze, linie orzecznicze i autotezy. Obok indeksu słownego działa indeks trigramowy, który wybacza odmianę i drobne różnice zapisu.

Ta warstwa jest niezastąpiona przy zapytaniu precyzyjnym: sygnatura, numer artykułu, nazwa instytucji prawnej, zwrot ustawowy. Zawodzi przy opisie potocznym.

Warstwa znaczeniowa

Treść orzeczeń jest pocięta na fragmenty i zamieniona na wektory. Zapytanie przechodzi tę samą zamianę, a system szuka fragmentów najbliższych znaczeniowo — niezależnie od użytych słów.

Przy trzech milionach orzeczeń porównanie z każdym wektorem byłoby zbyt wolne, więc wyszukiwanie idzie przez przybliżony indeks sąsiedztwa. Indeks jest wczytywany do pamięci przy starcie usługi, nie przy pytaniu użytkownika — inaczej pierwsze wyszukanie po restarcie trwałoby ponad dwie minuty.

Gdy warstwa wektorowa jest niedostępna, system schodzi na rezerwową metodę statystyczną. Stopniowa degradacja jest wpisana w konstrukcję: gorszy wynik jest lepszy niż brak wyniku, ale wynik gorszy nigdy nie jest podawany jako pewny.

Scalanie rankingów

Obie listy trafiają do jednego rankingu metodą odwrotności rang. Pozycja wysoka na którejkolwiek liście wynosi rekord w górę, a rekord obecny na obu — najwyżej.

Każde trafienie jest następnie rozwiązywane do rekordu bazy: fragment tekstu musi dać się przypisać do konkretnego orzeczenia albo artykułu. Trafienie, którego nie da się rozwiązać, jest odrzucane. To ta sama zasada, która na ekranie objawia się źródłem przy zdaniu.

Autotezy

Znaczna część orzeczeń sądów powszechnych nie ma tezy redakcyjnej — jest tylko uzasadnienie. Dla orzeczeń Sądu Najwyższego, sądów apelacyjnych i okręgowych baza zawiera autotezy: tezy wyprowadzone maszynowo z uzasadnień.

Autoteza jest oznaczona jako autoteza i nigdy nie jest podawana jako teza redakcyjna. Służy do znalezienia orzeczenia; do zacytowania służy uzasadnienie.

Trafność i jej granice

Wyszukiwarka dobiera zwykle od czterech do siedmiu zapytań na jedno pytanie użytkownika. Pierwsze nietrafione przeformułowuje i powtarza innym słownictwem. Nie oznacza to jednak, że przeszukała wszystko, co istotne.

Traktuj wynik jak dobrze wykonane pierwsze rozpoznanie, nie jak wyczerpującą zapytanie. Lista wykonanych zapytań jest jawna właśnie po to, żebyś mógł ocenić, czego nie sprawdzono, i dopytać.

O tym, jak aktualne są dane, mówi osobno Aktualność danych.

Danaco LEX v1.0.0 / © Danaco Holding Group · aktualizacja 2026-09-05Mapa strony
Zadaj pytanie