Skip to content

feat(multiseek): grupowanie wyników jako tabela krzyżowa (pivot)#670

Open
mpasternak wants to merge 12 commits into
devfrom
feat/multiseek-pivot-grupowanie
Open

feat(multiseek): grupowanie wyników jako tabela krzyżowa (pivot)#670
mpasternak wants to merge 12 commits into
devfrom
feat/multiseek-pivot-grupowanie

Conversation

@mpasternak

Copy link
Copy Markdown
Member

Cel

Dodaje do wyszukiwarki Multiseek nowy typ raportu „tabela krzyżowa" (pivot)
grupowanie zbiorcze wyników zamiast płaskiej listy. Użytkownik wybiera wymiar wierszy,
wymiar kolumn i metrykę w komórce (model pivota z Excela: Wiersze × Kolumny × Wartość),
dostaje macierz z sumami brzegowymi i wierszem/kolumną „RAZEM".

Ponieważ prace autora renderują się tym samym silnikiem multiseek, jedną implementacją
pokryte są jednocześnie Szukaj → Multiseek oraz grupowanie prac autora (po klinice,
rodzaju, charakterze, koszyku punktów PK itd.).

Zakres: faza 1 (multiseek). Ten sam pivot w „Szukaj → Zapytaniem" (DjangoQL),
drill-down do rekordów, „Wydział" jako wymiar i „uczciwe" punkty slotowe per-dyscyplina —
świadomie odłożone do fazy 2 (patrz spec §12).

Co w środku

  • Wymiary (wiersze): Rok · Charakter formalny · Charakter ogólny (rodzaj) · Typ MNiSW/MEiN ·
    Koszyk punktów PK · Język · Źródło · Jednostka · Dyscyplina · Autor. Kolumny — tylko
    wymiary o małej liczności.
  • Metryki: Liczba prac · Σ punkty PK · Σ Impact Factor · Σ cytowań · Σ punktacja wewnętrzna.
  • Konfiguracja przez GET (?pivot_row=…&pivot_col=…&pivot_val=…) → linkowalna,
    nie przebudowuje zapytania. Degeneracja „kolumny=(brak)" = płaska tabela zbiorcza.
  • Eksport macierzy do XLSX/CSV (omija cap 5000 — wyjściem jest mała macierz).
  • Bez migracji, bez zmian modeli (wszystko na bpp_rekord_mat/bpp_autorzy_mat).

Rzeczy nietrywialne (rozstrzygnięte)

  • Hybrydowa agregacja: wymiary rekordowe → dedup rekordów przez pk__in (filtr mnożący
    nie zawyża — K1); wymiary z tabeli Autorzy (jednostka/dyscyplina/autor) → unikatowe pary
    (rekord, wartość) + agregacja w Pythonie (rekord liczony raz per wartość — K2). Dublowanie
    między różnymi jednostkami jest zamierzone i opatrzone adnotacją pod tabelą.
  • Czyszczenie order_by() przed GROUP BY — inaczej default_ordering=["-rok"]/sort
    formularza wchodzi do grupowania i rozbija pivot (K3).
  • report_type to indeks pozycyjny — „pivot" dopisany na końcu listy (public=True),
    nie przesuwa zapisanych formularzy.

Testy

18 testów jednostkowych zbuduj_pivot/as_table (K1/K2/K3, join-reuse dla prac autora,
sumy brzegowe, etykiety FK, NULL-kubły, koszyk PK) + 7 testów widoku/eksportu.
85 zielonych (pivot + regresja multiseek), ruff + djLint czyste.

Dokumentacja procesu

Spec: docs/superpowers/specs/2026-07-24-multiseek-pivot-grupowanie-design.md
(v2 po self-review), plan: docs/superpowers/plans/2026-07-24-multiseek-pivot-grupowanie.md.

🤖 Generated with Claude Code

https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h

mpasternak and others added 12 commits July 24, 2026 19:54
Projekt fazy 1: pivot (Wiersze × Kolumny × Wartość) w silniku multiseek,
pokrywa Szukaj→Multiseek oraz prace autora. Nowy report_type + config w
GET, eksport XLSX/CSV, wymiary z Autorzy z adnotacją o dublowaniu.
Zapytanie/DjangoQL + drill-down + slot-based punkty = faza 2.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
…, eksport)

Wciągnięto findingi: hybrydowa strategia agregacji A/B (dedup rekordów
pk__in dla wymiarów rekordowych, distinct-pairs dla wymiarów autorskich),
czyszczenie order_by przed GROUP BY (K3), report_type jako indeks pozycyjny
na końcu listy (W1), obejście gate 25000 + cap 5000 eksportu (W3/W5),
mapowanie etykiet i NULL-kubłów, Wydział → faza 2 (dziura NULL-korzenia).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Task 1: PivotDimension/PivotMetric, DIMENSIONS/METRICS, parse_pivot_params.
fk_model jako string ścieżki + resolve_model (import-safe).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
…in-reuse, sumy, etykiety FK)

Cztery nowe testy §11.3/K2 (dwie różne jednostki), join-reuse JOIN-a
autorzy między filtrem wejściowym a wymiarem, rozwiązywanie etykiety FK
na prawdziwym id oraz sumy brzegowe. Fix: col_totals w _build_matrix nie
akumuluje już wpisu {None: grand_total} gdy brak wymiaru kolumnowego —
guard mirror'uje col_keys (tylko gdy col_dim jest ustawiony).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Co zmienia:
- multiseek_report_types: dopisany ReportType("pivot", "tabela
  krzyżowa") jako OSTATNI element listy (report_type to indeks
  pozycyjny - dopisanie na końcu nie przesuwa zapisanych formularzy).
- MyMultiseekResults.get_context_data: gałąź dla report_type=="pivot"
  liczy PivotResult (parse_pivot_params + zbuduj_pivot) na przefiltrowanym
  querysecie i wstawia do kontekstu (pivot/pivot_dimensions/pivot_metrics),
  omijając cache agregatów i qset.count() (paginator_count=0).
- Test src/bpp/tests/test_multiseek_pivot_view.py: widok zwraca 200 i
  kontekst "pivot" dla report_type=pivot (indeks liczony dynamicznie z
  registry.get_report_types), pomijanie sumy/count, oraz stabilność
  pozycji "pivot" na końcu listy (list/table nadal na 0/1).

Testy: test_multiseek_pivot_view.py 3 passed; regresja
src/bpp/tests/test_views (-k multiseek) 62 passed;
test_multiseek_djangoql_{export,endpoint}.py 34 passed.
Task 4: PivotResult.as_table() (render bez indeksowania słownika),
report-body-pivot.html (pasek selektorów GET + macierz + adnotacja pod
tabelą + linki eksportu), gałąź pivota w common-results.html omijająca
gate 25000/paginację, style _multiseek-reports.scss. Testy: as_table +
render HTML. 20 pivot + 62 regresja multiseek zielone.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Task 5: pivot_{csv,xlsx}_export_response budują macierz z PivotResult;
MyMultiseekExport._export_pivot rozgałęzia przed capem 5000 (wyjście to
mała macierz, nie lista rekordów). Testy XLSX/CSV.

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
Task 6: anonim widzi tabelę krzyżową, ale nie linki eksportu (LoginRequired).

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
- PivotTooLargeError + bramki PIVOT_MAX_CELLS/PIVOT_MAX_PAIRS (pivot jest
  publiczny i omija bramkę 25000 — anonim z ?pivot_row=autor na pustym
  filtrze mógł wybudować macierz z dziesiątkami tys. wierszy i wciągnąć
  miliony par autorstw do RAM). Strategia B iteruje z .iterator().
- Widok łapie błąd → szablon pokazuje "zawęź zapytanie" (pasek selektorów
  działa też na ekranie błędu); eksport zwraca 400.
- Uczciwy paginator_count dla breadcrumbu (liczba rekordów, nie 0).
- Domyślny tytuł sesji także dla pivota (_ensure_default_title).
- Dead code: usunięto fk_label_field, zwinięto label_kind "autor"→"fk".

Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
Claude-Session: https://claude.ai/code/session_01CQBbkTBBkt5ZKNN648gY2h
@mpasternak
mpasternak force-pushed the feat/multiseek-pivot-grupowanie branch from 54c0f91 to ecb05fd Compare July 24, 2026 17:59
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Labels

None yet

Projects

None yet

Development

Successfully merging this pull request may close these issues.

1 participant