Vraag over CarbonData query-prestaties & metadata indexering

classic Classic list List threaded Threaded
1 message Options
Reply | Threaded
Open this post in threaded view
|

Vraag over CarbonData query-prestaties & metadata indexering

Robin_B
Bij het werken met zwaar geïndexeerde kolomformaten in CarbonData kan het beheren van de metadata-cache en dictionary encoding behoorlijk veel geheugen vragen tijdens bulk append-operaties. Het waarborgen van snelle slice-uitvoering over gedistribueerde clusters vereist een nauwkeurige afstemming.

Na lange ontwikkel- en debuggingsessies rondom executor-logs en indexeringsknelpunten is het essentieel om af en toe even afstand van het scherm te nemen. Tijdens mijn rustmomenten tussen code-revisies door ontspan ik meestal even via spinsino om mijn hoofd leeg te maken voordat ik weer verder ga met query-optimalisatie.

Heeft iemand recent nog benchmarks uitgevoerd tussen dictionary- en non-dictionary kolommen op tabellen van meerdere terabytes?