Slackbot
09/20/2022, 7:30 AMkfaraz
09/20/2022, 7:51 AMUNNEST, so there is no direct way to explode the multi-value dimensions AFAIK.
One roundabout way I can think of is to use groupBy.
https://druid.apache.org/docs/latest/querying/multi-value-dimensions.html#grouping
You basically run a group by on the multi-value column and get the number of rows in the result.kfaraz
09/20/2022, 7:53 AMSELECT COUNT(*) FROM (
SELECT multi_value_column FROM your_datasource
GROUP BY 1
)Heiner
09/20/2022, 7:59 AMkfaraz
09/20/2022, 8:00 AMkfaraz
09/20/2022, 8:04 AMHeiner
09/20/2022, 8:10 AMkfaraz
09/20/2022, 8:13 AMHeiner
09/20/2022, 8:14 AMHeiner
09/20/2022, 8:14 AMkfaraz
09/20/2022, 8:15 AMkfaraz
09/20/2022, 8:16 AMDISTINCT already does the explode for us 🤦Heiner
09/20/2022, 8:16 AMHeiner
09/20/2022, 8:18 AMkfaraz
09/20/2022, 8:18 AMCOUNT(DISTINCT) take?Heiner
09/20/2022, 8:19 AMHeiner
09/20/2022, 8:20 AMkfaraz
09/20/2022, 8:21 AMHeiner
09/20/2022, 8:21 AMkfaraz
09/20/2022, 8:22 AMkfaraz
09/20/2022, 8:22 AMHeiner
09/20/2022, 8:24 AMkfaraz
09/20/2022, 8:26 AMkfaraz
09/20/2022, 8:26 AMHeiner
09/20/2022, 8:27 AMHeiner
09/20/2022, 8:27 AMHeiner
09/20/2022, 8:27 AMHeiner
09/20/2022, 8:27 AMkfaraz
09/20/2022, 8:28 AMHeiner
09/20/2022, 8:29 AMHeiner
09/20/2022, 8:30 AMHeiner
09/20/2022, 8:31 AMHeiner
09/20/2022, 8:32 AMkfaraz
09/20/2022, 8:32 AMkfaraz
09/20/2022, 8:33 AMstill wondering where the discrepancy between workaround and COUNT(DISTINCT) is coming from...Maybe
useApproximateCountDistinct is set to true?kfaraz
09/20/2022, 8:34 AMYou can try to push your segment size to 200k or 500k even, atleast as an experiment.Druid normally advises segment size of 2M to 5M rows, but given that row size seems big, you can experiment in incremental steps and try to push it to 1M.
Heiner
09/20/2022, 8:34 AMkfaraz
09/20/2022, 8:35 AMHeiner
09/20/2022, 8:35 AMuseApproximateCountDistinctHeiner
09/20/2022, 8:35 AMHeiner
09/20/2022, 8:35 AMHeiner
09/20/2022, 8:36 AMHeiner
09/20/2022, 8:53 AMkfaraz
09/20/2022, 8:53 AM