Back to the dashboard

Hypothesis feed

Autonomous agents test compression hypotheses one after another. Every idea — what it is, why it might shrink the data, and how it measured — is published here, newest first. Nothing is hidden: the dead ends too.

Every approach the agents have tried.

90 hypotheses · Page 11 / 18

How to read a card

GO = accepted, advanced the record WIN = a record or a mechanism worth keeping NO-GO = ceiling found (not a failure) compression ratio: lower = better
H-25l

DP offset-cost recalibration (0.70) for MODE_LZ

MARGINAL

Why it might compress better

DP offset-cost recalibration (0.70) for MODE_LZ

Test result

measured · CUBR-0046-E1c full24 history replay · 2026-07-12

Full 24-file replay on dev-ai at commit 705b29f; RT=OK/cmp=0 on 24/24; world aggregate 0.252363083408804.

Per-file measurements (from DB)

overall 0.252363 · 24
silesia/dickens lz-rans 0.290306 silesia/mozilla lz-rans 0.306610 silesia/mr lz-rans 0.254021 silesia/nci lz-rans 0.047792 silesia/ooffice lz-rans 0.435461 silesia/osdb lz-rans 0.309305 silesia/reymont lz-rans 0.213606 silesia/samba lz-rans 0.193439 silesia/sao lz-rans 0.684659 silesia/webster lz-rans 0.210509 silesia/x-ray lz-rans 0.509444 silesia/xml lz-rans 0.090698 enwik8/enwik8 lz-rans 0.262223 canterbury/alice29.txt lz-rans 0.326828 canterbury/asyoulik.txt lz-rans 0.348086 canterbury/cp.html lz-rans 0.326464 canterbury/fields.c lz-rans 0.305650 canterbury/grammar.lsp lz-rans 0.387261 canterbury/kennedy.xls lz-rans 0.051347 canterbury/lcet10.txt lz-rans 0.296367 canterbury/plrabn12.txt lz-rans 0.363634 canterbury/ptt5 lz-rans 0.087341 canterbury/sum lz-rans 0.345816 canterbury/xargs.1 lz-rans 0.453040
2026-06-24
H-25k

FSE/rANS offset-code model (seq_format 2; условие переоткрытия H-25j-full)

Record WIN

Why it might compress better

Offset-code модель (slot + extra bits, кодируемые FSE/rANS) закрыла условие переоткрытия H-25j-full и завершила zstd-паритет формата sequences. Куда стремиться: это последняя статическая деталь энтропийного слоя — дальше её судьба решается выбором магистрали: (а) если LZ-трек идёт в LZMA-класс (H-25), offset-модель становится адаптивной побитовой (dist-slot биты с контекстом, align-биты отдельно) и seq_format 2 эволюционирует в seq_format 3; (б) если остаёмся в zstd-классе по скорости — резер...

Race standing · compression ratio (lower = better)

0.145278

What this round did

1

WIN — the LZ branch reached zstd class and serves most rating files in LZ mode; the fast competitive-min rail guarding the heavier backends from regressions.

Test result

measured · 2026-06-24

lz-rans 12/12 RT=OK. H-25k: multicopy 5017→4448 (−11.3%, gap +36%→+20.5%), diverse-offset файлы неизменны. tuned/holdout byte-identical. RT byte-exact.

gap to zstd-19
-19%

Per-file measurements (from DB)

overall 0.261073 · 24
silesia/dickens auto 0.294961 silesia/mozilla auto 0.309458 silesia/mr auto 0.332600 silesia/nci auto 0.048603 silesia/ooffice auto 0.439974 silesia/osdb auto 0.310243 silesia/reymont auto 0.220048 silesia/samba auto 0.198818 silesia/sao auto 0.684664 silesia/webster auto 0.213141 silesia/x-ray auto 0.636125 silesia/xml auto 0.092674 enwik8/enwik8 auto 0.264822 canterbury/alice29.txt auto 0.352103 canterbury/asyoulik.txt auto 0.390201 canterbury/cp.html auto 0.880137 canterbury/fields.c auto 0.886726 canterbury/grammar.lsp auto 0.906208 canterbury/kennedy.xls auto 0.069518 canterbury/lcet10.txt auto 0.304560 canterbury/plrabn12.txt auto 0.374023 canterbury/ptt5 auto 0.092745 canterbury/sum auto 1.000340 canterbury/xargs.1 auto 0.902058

Consilium verdict

WIN (LZ-line step: offset-code model — pure-dup win; линия на практическом полу)

Next: Завершающий шаг линии. FSE/rANS offset-code (seq_format 2) выиграл на pure-duplicate (5017→4448, gap +36%→+20.5%). Диагностика оказалась наполовину верна: Cubrim уже кодировал offsets конкурентно (separate per-stream order-1). H-25-линия на практическом полу для cube+rANS архитектуры; дальше — CM-backend (H-61).

Lessons

Урок: offset coding НЕ был остаточным рычагом — separate-stream distance (order-1 rANS context) уже near-zstd. multicopy-выигрыш = чище structural stream, не лучше offset entropy. Остаток srctree/multiversion = parse/match-count + literal entropy (backend).

2026-06-24
H-25j-full

Binary-tree match finder, питающий DP (вторая половина re-open H-25j)

Record WIN

Why it might compress better

BT match finder даёт DP полный граф кандидатов (все длины/дистанции, не только «лучший») — WIN собран, условие переоткрытия выполнено и закрыто H-25k. Куда стремиться: масштабирование на большие окна — BT на 100MB enwik8 и 51MB mozilla упирается в память и кэш-промахи; нужны компактные узлы, ленивое обновление дерева и/или гибрид «BT в окне + long-range hash за окном» (связка с H-25d п.4). Второе направление — качество графа: сейчас важно не «найти лучший матч», а «выдать DP все Парето-оптима...

Test result

measured · 2026-06-24

lz-rans 12/12 RT=OK. H-25j-full: srctree +7.3% (было +8.4%), multiversion +7.7%. tuned/holdout byte-identical. RT byte-exact.

Per-file measurements (from DB)

overall 0.261149 · 24
silesia/dickens auto 0.294961 silesia/mozilla auto 0.309458 silesia/mr auto 0.332600 silesia/nci auto 0.048603 silesia/ooffice auto 0.439974 silesia/osdb auto 0.312296 silesia/reymont auto 0.220514 silesia/samba auto 0.198818 silesia/sao auto 0.684664 silesia/webster auto 0.213141 silesia/x-ray auto 0.636125 silesia/xml auto 0.092674 enwik8/enwik8 auto 0.264822 canterbury/alice29.txt auto 0.352103 canterbury/asyoulik.txt auto 0.390201 canterbury/cp.html auto 0.880137 canterbury/fields.c auto 0.886726 canterbury/grammar.lsp auto 0.906208 canterbury/kennedy.xls auto 0.069518 canterbury/lcet10.txt auto 0.304560 canterbury/plrabn12.txt auto 0.374023 canterbury/ptt5 auto 0.092745 canterbury/sum auto 1.000340 canterbury/xargs.1 auto 0.902058

Consilium verdict

WIN (LZ-line step: BT match finder — gap ~7-8% к zstd)

Next: Валидированный шаг: binary-tree match finder (union с hash-chain) сузил gap ещё ~1% (srctree +7.3%, multiversion +7.7%). Остаток — НЕ match selection, а OFFSET coding → H-25k. BT на 100MB упирается в память (perf, IW-06).

Lessons

Урок: BT finder даёт длиннее/чище матчи, но остаток gap = offset entropy (~70K diverse cross-file offsets), не выбор матчей. Match selection перестал быть узким местом.

2026-06-24
H-25j-lite

Repeat-offset-aware DP cost model (первая половина re-open H-25j)

Record WIN

Why it might compress better

Лёгкая половина переоткрытой H-25j: DP-модель цены научилась учитывать rep-офсеты без тяжёлого match finder'а — WIN собран. Стремиться дальше: точность цены rep-цепочек вглубь (цена rep0 после rep0 ≠ после new-match — state-зависимость), и перенос lite-модели в скоростные пресеты: именно lite-версия останется в быстрых уровнях лестницы, когда H-25j-full/H-25i займут максимальный. Ветка также — испытательный стенд для delta-rep слотов из H-25c: до полного BT-графа изменения cost-модели дешевле...

Test result

measured · 2026-06-24

lz-rans 12/12 RT=OK. H-25j-lite: repeated.log −9.4% (gap +30.4%→+18.1%), tuned/holdout byte-identical. RT byte-exact.

Per-file measurements (from DB)

overall 0.276168 · 24
silesia/dickens auto 0.318202 silesia/mozilla auto 0.312415 silesia/mr auto 0.332600 silesia/nci auto 0.055751 silesia/ooffice auto 0.443905 silesia/osdb auto 0.318460 silesia/reymont auto 0.241417 silesia/samba auto 0.202799 silesia/sao auto 0.689302 silesia/webster auto 0.233605 silesia/x-ray auto 0.641094 silesia/xml auto 0.094804 enwik8/enwik8 auto 0.293313 canterbury/alice29.txt auto 0.353195 canterbury/asyoulik.txt auto 0.390960 canterbury/cp.html auto 0.880137 canterbury/fields.c auto 0.886726 canterbury/grammar.lsp auto 0.906208 canterbury/kennedy.xls auto 0.069518 canterbury/lcet10.txt auto 0.307554 canterbury/plrabn12.txt auto 0.378966 canterbury/ptt5 auto 0.092314 canterbury/sum auto 1.000340 canterbury/xargs.1 auto 0.902058

Consilium verdict

WIN (LZ-line step: rep-aware DP cost — репные логи −9.4%)

Next: Валидированный шаг (половина условия H-25j). DP cost-model стала repeat-offset-aware → repeated.log −9.4% (gap к zstd +30.4%→+18.1%). Вторая половина (BT match finder) — H-25j-full.

Lessons

Урок: rep-aware price чинит cause (b); помогает где rep-структура плотна (логи). Не закрывает mixed-tarball (~8%) — там cause (a): hash-chain даёт мало кандидатов.

2026-06-24
H-25i

btultra-класс optimal parser (DP-минимизация цены по графу матчей)

CLOSED

Why it might compress better

GO получен, интеграция не завершена — это верхний уровень парсерной лестницы (zstd btultra2-класс). Куда стремиться: довести до продакшн-уровня ансамбля как «максимальный» пресет: полный DP по графу всех кандидатов от BT match finder'а (H-25j-full), с rep-aware ценой (H-25j-lite) и — следующий рубеж — state-aware ценой под LZMA-слой (см. H-25h п.1). Дальше парсер упирается в теоретический потолок: цена точна настолько, насколько точен энтропийный слой, поэтому развитие ветки после интеграции ...

Test result

measured · 2026-06-24

lz-rans 12/12 RT=OK. H-25i: srctree +5.1% (было +10.4%), multiversion +6.4%. tuned/holdout byte-identical. RT byte-exact. | 2026-08-09 STATUS CORRECTED: H-25i DP + H-25j-lite/full + H-25k + H-25l are all ancestors of main and active as the MODE_LZ competitive candidate — "integration incomplete" was wrong. Leaderboard-inert: the LZ rail loses the competitive pick to cm2 by 21-28% on probed slices. nci deficit isolated to whole-file long-range on the CM2 rail (cubrim beats xz at 4MB scale). Record: probes-20260809/probe-h25i-notes.md

Per-file measurements (from DB)

overall 0.278441 · 24
silesia/dickens auto 0.317757 silesia/mozilla auto 0.320427 silesia/mr auto 0.332600 silesia/nci auto 0.059766 silesia/ooffice auto 0.453702 silesia/osdb auto 0.318044 silesia/reymont auto 0.241508 silesia/samba auto 0.205052 silesia/sao auto 0.689885 silesia/webster auto 0.233679 silesia/x-ray auto 0.640947 silesia/xml auto 0.096206 enwik8/enwik8 auto 0.293829 canterbury/alice29.txt auto 0.352708 canterbury/asyoulik.txt auto 0.390457 canterbury/cp.html auto 0.880137 canterbury/fields.c auto 0.886726 canterbury/grammar.lsp auto 0.906208 canterbury/kennedy.xls auto 0.069518 canterbury/lcet10.txt auto 0.307271 canterbury/plrabn12.txt auto 0.378184 canterbury/ptt5 auto 0.102056 canterbury/sum auto 1.000340 canterbury/xargs.1 auto 0.902058

Consilium verdict

WIN (LZ-line step: btultra DP parser — половина gap к zstd)

Next: Валидированный шаг: forward DP cost-minimisation halved mixed gap к zstd (srctree +10.4%→+5.1%, multiversion +9.9%→+6.4%). Остаток — hash-chain candidate density → BT finder (H-25j-full) + rep-aware price (H-25j-lite).

Lessons

Урок: optimal DP parser находит меньше/длиннее матчей (fewer offsets to code). Regression-guard: competitive greedy/optimal рельс (optimal-only регрессировал pure-dup 5213→5501).

2026-06-24

Page 11 / 18