mysterious-lamp-91034
12/23/2021, 5:07 AMdatahub docker check shows no issue
The context is I am running docker-compose.quickstart.yml in my dev machineloud-island-88694
better-orange-49102
12/23/2021, 6:23 AMmysterious-lamp-91034
12/23/2021, 6:42 AMbetter-orange-49102
12/23/2021, 6:47 AMcurl -X GET <http://elasticsearch:9200/_cat/indices>
show any red indices?mysterious-lamp-91034
12/23/2021, 6:48 AMbetter-orange-49102
12/23/2021, 6:49 AMmysterious-lamp-91034
12/23/2021, 6:49 AMbetter-orange-49102
12/23/2021, 6:55 AMsquare-activity-64562
12/23/2021, 8:36 AMsquare-activity-64562
12/23/2021, 10:24 AMsquare-activity-64562
12/23/2021, 10:27 AMdocker info | grep Memgreen-football-43791
12/23/2021, 3:49 PMmysterious-lamp-91034
12/23/2021, 3:49 PMgreen-football-43791
12/23/2021, 3:50 PMgreen-football-43791
12/23/2021, 3:50 PMmysterious-lamp-91034
12/23/2021, 3:50 PMgreen-football-43791
12/23/2021, 3:50 PMgreen-football-43791
12/23/2021, 3:50 PMmysterious-lamp-91034
12/23/2021, 3:51 PMgreen-football-43791
12/23/2021, 3:51 PMgreen-football-43791
12/23/2021, 3:51 PMgreen-football-43791
12/23/2021, 3:52 PMmysterious-lamp-91034
12/23/2021, 3:52 PMgreen-football-43791
12/23/2021, 3:52 PMgreen-football-43791
12/23/2021, 3:52 PMdocker statsgreen-football-43791
12/23/2021, 3:53 PMmysterious-lamp-91034
12/23/2021, 3:54 PMdatahub docker check
The following issues were detected:
- elasticsearch-setup container is not present
- kafka-setup container is not present
Then I ran
datahub docker quickstart --quickstart-compose-file ./docker/quickstart/docker-compose.quickstart.yml
again.mysterious-lamp-91034
12/23/2021, 4:01 PMThe following issues were detected:
- kafka-setup container is not present
- elasticsearch-setup container is not present
This happens againmysterious-lamp-91034
12/23/2021, 4:03 PMmysterious-lamp-91034
12/23/2021, 4:04 PMmysterious-lamp-91034
12/23/2021, 4:05 PMgreen-football-43791
12/23/2021, 4:12 PMdatahub docker quickstart? without specifying a compose file?green-football-43791
12/23/2021, 4:13 PMgreen-football-43791
12/23/2021, 4:13 PMdocker logs --follow datahub-gmsgreen-football-43791
12/23/2021, 4:14 PMgreen-football-43791
12/23/2021, 4:14 PMgreen-football-43791
12/23/2021, 4:15 PMgreen-football-43791
12/23/2021, 4:16 PMgreen-football-43791
12/23/2021, 4:16 PMmysterious-lamp-91034
12/23/2021, 4:29 PMhave you tried running just w/The reason I did not do that is I have a port conflict with 8081. I have to modify the compose file? without specifying a compose file?datahub docker quickstart
you can doLooks like keep poping up a lot of message with old timestampdocker logs --follow datahub-gms
03:44:38.160 [I/O dispatcher 1] INFO c.l.m.s.e.update.BulkListener:28 - Successfully fed bulk request. Number of events: 1 Took time ms: -1
03:44:38.219 [qtp544724190-58] INFO c.l.metadata.entity.EntityService:549 - INGEST urn urn:li:dataset:(urn:li:dataPlatform:pinterest-hive,weiranliu.no_sa_active_users_base,PROD) with system metadata {lastObserved=1640231078216, runId=pinterest-hive-2021_12_22-23_45_58}
03:44:38.224 [mae-consumer-job-client-0-C-1] INFO c.l.m.k.MetadataAuditEventsProcessor:101 - {urn=urn:li:dataset:(urn:li:dataPlatform:pinterest-hive,weiranliu.no_sa_active_users_base,PROD), aspects=[{com.linkedin.metadata.key.DatasetKey={name=weiranliu.no_sa_active_users_base, platform=urn:li:dataPlatform:pinterest-hive, origin=PROD}}, {com.linkedin.common.Status={removed=false}}]}
03:44:38.229 [I/O dispatcher 1] INFO c.l.m.s.e.update.BulkListener:28 - Successfully fed bulk request. Number of events: 1 Took time ms: -1
03:44:38.229 [mae-consumer-job-client-0-C-1] INFO c.l.m.k.MetadataAuditEventsProcessor:101 - {urn=urn:li:dataset:(urn:li:dataPlatform:pinterest-hive,weiranl
if you go to docker desktop > settings > resources, how many GB of memory have you allocated to docker?I am running datahub in my devserver in ubuntu
mysterious-lamp-91034
12/23/2021, 4:34 PMdocker logs --follow datahub-gms --since 2021-12-23T16:33:02Zgreen-football-43791
12/23/2021, 4:35 PMdocker logs --follow datahub-gms without the since? and then refresh?mysterious-lamp-91034
12/23/2021, 4:35 PMgreen-football-43791
12/23/2021, 4:36 PMI am running datahub in my devserver in ubuntugot it- what are the resources allocated to the machine overall?
green-football-43791
12/23/2021, 4:36 PMCaused by: org.elasticsearch.ElasticsearchException: Elasticsearch exception [type=too_many_buckets_exception, reason=Trying to create too many buckets. Must be less than or equal to: [65535] but was [65536]. This limit can be set by changing the [search.max_buckets] cluster level setting.]green-football-43791
12/23/2021, 4:36 PMgreen-football-43791
12/23/2021, 4:38 PMgreen-football-43791
12/23/2021, 4:39 PMmysterious-lamp-91034
12/23/2021, 4:40 PMwhat are the resources allocated to the machine overall?
vmstat -s
71926472 K total memory
13810968 K used memory
21901644 K active memory
12815148 K inactive memory
31164780 K free memory
1190164 K buffer memory
25760560 K swap cache
0 K total swap
0 K used swap
0 K free swap
22794417 non-nice user cpu ticks
3286348 nice user cpu ticks
9313976 system cpu ticks
1471659686 idle cpu ticks
169654 IO-wait cpu ticks
0 IRQ cpu ticks
1194434 softirq cpu ticks
23468 stolen cpu ticks
5761549 pages paged in
386317985 pages paged out
0 pages swapped in
0 pages swapped out
1108917083 interrupts
2096488378 CPU context switches
1639858236 boot time
5937327 forks
what version of datahub are you running?I git pull the repo yesterday. I am developing my ingestion source so the DataHub CLI version is unavailable
mysterious-lamp-91034
12/23/2021, 4:41 PMgreen-football-43791
12/23/2021, 4:41 PMgreen-football-43791
12/23/2021, 4:42 PMgreen-football-43791
12/23/2021, 4:42 PMgreen-football-43791
12/23/2021, 4:42 PMgreen-football-43791
12/23/2021, 4:42 PMgreen-football-43791
12/23/2021, 4:42 PMgreen-football-43791
12/23/2021, 4:43 PMmysterious-lamp-91034
12/23/2021, 4:43 PMare you generating custom browse path aspects for your custom source?No
green-football-43791
12/23/2021, 4:44 PMmysterious-lamp-91034
12/23/2021, 4:44 PMgreen-football-43791
12/23/2021, 4:44 PMmysterious-lamp-91034
12/23/2021, 4:45 PMgreen-football-43791
12/23/2021, 4:45 PMgreen-football-43791
12/23/2021, 4:45 PM<namespace>.<table_name>?mysterious-lamp-91034
12/23/2021, 4:45 PMgreen-football-43791
12/23/2021, 4:45 PMmysterious-lamp-91034
12/23/2021, 4:46 PMgreen-football-43791
12/23/2021, 4:47 PMgreen-football-43791
12/23/2021, 4:48 PMgreen-football-43791
12/23/2021, 4:48 PMgreen-football-43791
12/23/2021, 4:49 PMgreen-football-43791
12/23/2021, 4:49 PMmysterious-lamp-91034
12/23/2021, 4:50 PMare you on an incompatible hive version?Yes. Hive 1.2 that is incompatible
mysterious-lamp-91034
12/23/2021, 4:54 PMhow many different namespaces do you have?2133
green-football-43791
12/23/2021, 4:54 PMgreen-football-43791
12/23/2021, 4:54 PMgreen-football-43791
12/23/2021, 4:54 PMgreen-football-43791
12/23/2021, 4:55 PMmysterious-lamp-91034
12/23/2021, 4:55 PMgreen-football-43791
12/23/2021, 4:55 PMgreen-football-43791
12/23/2021, 4:56 PMmysterious-lamp-91034
12/23/2021, 4:56 PMgreen-football-43791
12/23/2021, 4:56 PMgreen-football-43791
12/23/2021, 4:56 PMmysterious-lamp-91034
12/23/2021, 4:57 PMmysterious-lamp-91034
12/23/2021, 5:05 PMgreen-football-43791
12/23/2021, 5:06 PMgreen-football-43791
12/23/2021, 5:07 PMmysterious-lamp-91034
12/23/2021, 5:11 PMgreen-football-43791
12/23/2021, 5:12 PMgreen-football-43791
12/23/2021, 5:12 PMmysterious-lamp-91034
12/23/2021, 5:12 PMboundless-student-48844
02/08/2022, 4:26 AMso, there generally should only be a browse path for each dataset containerhey @green-football-43791, can I check if this is the case in latest datahub version? i still see that the browse path is still 1:1 bound to dataset name
boundless-student-48844
02/08/2022, 4:27 AMloud-island-88694
boundless-student-48844
02/08/2022, 5:02 AMbig-carpet-38439
02/08/2022, 5:39 AMloud-island-88694
mysterious-lamp-91034
03/24/2022, 4:50 PMCaused by: org.elasticsearch.ElasticsearchException: Elasticsearch exception [type=too_many_buckets_exception, reason=Trying to create too many buckets. Must be less than or equal to: [65535] but was [65536]. This limit can be set by changing the [search.max_buckets] cluster level setting.]big-carpet-38439
03/24/2022, 7:40 PMbig-carpet-38439
03/24/2022, 7:40 PMbig-carpet-38439
03/24/2022, 7:40 PMmysterious-lamp-91034
03/24/2022, 9:35 PMmysterious-lamp-91034
03/28/2022, 9:58 PMhappy-orange-71237
07/14/2022, 7:35 PM13:11:56.109 [Thread-143] ERROR c.l.m.s.e.query.ESBrowseDAO:126 - Browse query failed: Elasticsearch exception [type=search_phase_execution_exception, reason=]
13:11:56.109 [Thread-143] ERROR c.l.d.g.r.browse.BrowseResolver:60 - Failed to execute browse: entity type: DATASET, path: [prod, postgres, kafka_alias101], filters: null, start: 0, count: 10 Browse query failed:
13:11:56.113 [Thread-143] ERROR c.l.d.g.e.DataHubDataFetcherExceptionHandler:21 - Failed to execute DataFetcher
java.util.concurrent.CompletionException: java.lang.RuntimeException: Failed to execute browse: entity type: DATASET, path: [prod, postgres, kafka_alias101], filters: null, start: 0, count: 10
at java.util.concurrent.CompletableFuture.encodeThrowable(CompletableFuture.java:273)
at java.util.concurrent.CompletableFuture.completeThrowable(CompletableFuture.java:280)
at java.util.concurrent.CompletableFuture$AsyncSupply.run(CompletableFuture.java:1606)
at java.lang.Thread.run(Thread.java:748)
Caused by: java.lang.RuntimeException: Failed to execute browse: entity type: DATASET, path: [prod, postgres, kafka_alias101], filters: null, start: 0, count: 10
at com.linkedin.datahub.graphql.resolvers.browse.BrowseResolver.lambda$get$1(BrowseResolver.java:68)
at java.util.concurrent.CompletableFuture$AsyncSupply.run(CompletableFuture.java:1604)
... 1 common frames omitted
Caused by: com.datahub.util.exception.ESQueryException: Browse query failed:
at com.linkedin.metadata.search.elasticsearch.query.ESBrowseDAO.browse(ESBrowseDAO.java:127)
at com.linkedin.metadata.search.elasticsearch.ElasticSearchService.browse(ElasticSearchService.java:105)
at com.linkedin.entity.client.JavaEntityClient.browse(JavaEntityClient.java:175)
at com.linkedin.datahub.graphql.types.dataset.DatasetType.browse(DatasetType.java:170)
at com.linkedin.datahub.graphql.resolvers.browse.BrowseResolver.lambda$get$1(BrowseResolver.java:52)
... 2 common frames omitted
Caused by: org.elasticsearch.ElasticsearchStatusException: Elasticsearch exception [type=search_phase_execution_exception, reason=]
at org.elasticsearch.rest.BytesRestResponse.errorFromXContent(BytesRestResponse.java:187)
at org.elasticsearch.client.RestHighLevelClient.parseEntity(RestHighLevelClient.java:1892)
at org.elasticsearch.client.RestHighLevelClient.parseResponseException(RestHighLevelClient.java:1869)
at org.elasticsearch.client.RestHighLevelClient.internalPerformRequest(RestHighLevelClient.java:1626)
at org.elasticsearch.client.RestHighLevelClient.performRequest(RestHighLevelClient.java:1583)
at org.elasticsearch.client.RestHighLevelClient.performRequestAndParseEntity(RestHighLevelClient.java:1553)
at org.elasticsearch.client.RestHighLevelClient.search(RestHighLevelClient.java:1069)
at com.linkedin.metadata.search.elasticsearch.query.ESBrowseDAO.browse(ESBrowseDAO.java:96)
... 6 common frames omitted
Suppressed: org.elasticsearch.client.ResponseException: method [POST], host [<https://vpc-datahubpoc2-3y2kiko4mdy2r6avw2syw67fby.us-east-1.es.amazonaws.com:443>], URI [/datasetindex_v2/_search?typed_keys=true&max_concurrent_shard_requests=5&ignore_unavailable=false&expand_wildcards=open&allow_no_indices=true&ignore_throttled=true&search_type=query_then_fetch&batched_reduce_size=512&ccs_minimize_roundtrips=true], status line [HTTP/1.1 503 Service Unavailable]
{"error":{"root_cause":[],"type":"search_phase_execution_exception","reason":"","phase":"fetch","grouped":true,"failed_shards":[],"caused_by":{"type":"too_many_buckets_exception","reason":"Trying to create too many buckets. Must be less than or equal to: [65535] but was [65536]. This limit can be set by changing the [search.max_buckets] cluster level setting.","max_buckets":65535}},"status":503}
at org.elasticsearch.client.RestClient.convertResponse(RestClient.java:302)
at org.elasticsearch.client.RestClient.performRequest(RestClient.java:272)
at org.elasticsearch.client.RestClient.performRequest(RestClient.java:246)
at org.elasticsearch.client.RestHighLevelClient.internalPerformRequest(RestHighLevelClient.java:1613)
... 10 common frames omitted
Caused by: org.elasticsearch.ElasticsearchException: Elasticsearch exception [type=too_many_buckets_exception, reason=Trying to create too many buckets. Must be less than or equal to: [65535] but was [65536]. This limit can be set by changing the [search.max_buckets] cluster level setting.]
at org.elasticsearch.ElasticsearchException.innerFromXContent(ElasticsearchException.java:496)
at org.elasticsearch.ElasticsearchException.fromXContent(ElasticsearchException.java:407)
at org.elasticsearch.ElasticsearchException.innerFromXContent(ElasticsearchException.java:437)
at org.elasticsearch.ElasticsearchException.failureFromXContent(ElasticsearchException.java:603)
at org.elasticsearch.rest.BytesRestResponse.errorFromXContent(BytesRestResponse.java:179)
... 13 common frames omitted
Full stack trace is in the attached file. As the error message says, we could increase the number of buckets in elastic search to higher than 65535 but 65535 already sounds like a lot of buckets.
@big-carpet-38439 Is this related to the issue you were fixing above? I assume that by now the changes you mentioned above are in the product.square-activity-64562
07/15/2022, 7:34 AMhappy-orange-71237
07/15/2022, 4:08 PMbulky-grass-52762
07/21/2022, 4:38 PM06:23:57.918 [pool-10-thread-1] INFO c.l.m.filter.RestliLoggingFilter:55 - GET /entitiesV2?ids=List(urn%3Ali%3Acorpuser%3Asalih.can@udemy.com) - batchGet - 200 - 4ms
06:23:57.944 [I/O dispatcher 1] INFO c.l.m.k.e.ElasticsearchConnector:41 - Successfully feeded bulk request. Number of events: 1 Took time ms: -1
... 27 common frames omitted
06:23:57.856 [Thread-25115] ERROR c.datahub.graphql.GraphQLController:98 - Errors while executing graphQL query: "query getMe {\n me {\n corpUser {\n urn\n username\n info {\n active\n displayName\n title\n firstName\n lastName\n fullName\n email\n __typename\n }\n editableProperties {\n displayName\n title\n pictureLink\n teams\n skills\n __typename\n }\n __typename\n }\n platformPrivileges {\n viewAnalytics\n managePolicies\n manageIdentities\n generatePersonalAccessTokens\n manageIngestion\n manageSecrets\n manageDomains\n manageTests\n manageGlossaries\n manageUserCredentials\n __typename\n }\n __typename\n }\n}\n", result: {errors=[{message=An unknown error occurred., locations=[{line=2, column=3}], path=[me], extensions={code=500, type=SERVER_ERROR, classification=DataFetchingException}}], data={me=null}, extensions={tracing={version=1, startTime=2022-07-18T06:23:57.826Z, endTime=2022-07-18T06:23:57.856Z, duration=29691126, parsing={startOffset=236621, duration=217511}, validation={startOffset=384372, duration=138868}, execution={resolvers=[{path=[me], parentType=Query, returnType=AuthenticatedUser, fieldName=me, startOffset=418447, duration=28545139}]}}}}, errors: [DataHubGraphQLError{path=[me], code=SERVER_ERROR, locations=[SourceLocation{line=2, column=3}]}]
06:23:58.437 [Thread-29132] ERROR c.l.m.s.e.query.ESBrowseDAO:126 - Browse query failed: Elasticsearch exception [type=search_phase_execution_exception, reason=all shards failed]
06:23:58.437 [Thread-29132] ERROR c.l.d.g.r.browse.BrowseResolver:60 - Failed to execute browse: entity type: DATASET, path: [prod, hive], filters: null, start: 0, count: 10 Browse query failed:
06:23:58.437 [Thread-29132] ERROR c.l.d.g.e.DataHubDataFetcherExceptionHandler:21 - Failed to execute DataFetcher
java.util.concurrent.CompletionException: java.lang.RuntimeException: Failed to execute browse: entity type: DATASET, path: [prod, hive], filters: null, start: 0, count: 10
at java.util.concurrent.CompletableFuture.encodeThrowable(CompletableFuture.java:273)
at java.util.concurrent.CompletableFuture.completeThrowable(CompletableFuture.java:280)
at java.util.concurrent.CompletableFuture$AsyncSupply.run(CompletableFuture.java:1606)
at java.lang.Thread.run(Thread.java:748)
Caused by: java.lang.RuntimeException: Failed to execute browse: entity type: DATASET, path: [prod, hive], filters: null, start: 0, count: 10
at com.linkedin.datahub.graphql.resolvers.browse.BrowseResolver.lambda$get$1(BrowseResolver.java:68)
at java.util.concurrent.CompletableFuture$AsyncSupply.run(CompletableFuture.java:1604)
... 1 common frames omitted
Caused by: com.datahub.util.exception.ESQueryException: Browse query failed:
at com.linkedin.metadata.search.elasticsearch.query.ESBrowseDAO.browse(ESBrowseDAO.java:127)
at com.linkedin.metadata.search.elasticsearch.ElasticSearchService.browse(ElasticSearchService.java:105)
at com.linkedin.entity.client.JavaEntityClient.browse(JavaEntityClient.java:175)
at com.linkedin.datahub.graphql.types.dataset.DatasetType.browse(DatasetType.java:170)
at com.linkedin.datahub.graphql.resolvers.browse.BrowseResolver.lambda$get$1(BrowseResolver.java:52)
... 2 common frames omitted
Caused by: org.elasticsearch.ElasticsearchStatusException: Elasticsearch exception [type=search_phase_execution_exception, reason=all shards failed]
at org.elasticsearch.rest.BytesRestResponse.errorFromXContent(BytesRestResponse.java:187)
at org.elasticsearch.client.RestHighLevelClient.parseEntity(RestHighLevelClient.java:1892)
at org.elasticsearch.client.RestHighLevelClient.parseResponseException(RestHighLevelClient.java:1869)
at org.elasticsearch.client.RestHighLevelClient.internalPerformRequest(RestHighLevelClient.java:1626)
at org.elasticsearch.client.RestHighLevelClient.performRequest(RestHighLevelClient.java:1583)
at org.elasticsearch.client.RestHighLevelClient.performRequestAndParseEntity(RestHighLevelClient.java:1553)
at org.elasticsearch.client.RestHighLevelClient.search(RestHighLevelClient.java:1069)
at com.linkedin.metadata.search.elasticsearch.query.ESBrowseDAO.browse(ESBrowseDAO.java:96)
... 6 common frames omitted
Suppressed: org.elasticsearch.client.ResponseException: method [POST], host [<https://es.udemy.com:9999>], URI [/datahub_datasetindex_v2/_search?typed_keys=true&max_concurrent_shard_requests=5&ignore_unavailable=false&expand_wildcards=open&allow_no_indices=true&ignore_throttled=true&search_type=query_then_fetch&batched_reduce_size=512&ccs_minimize_roundtrips=true], status line [HTTP/1.1 503 Service Unavailable]
{"error":{"root_cause":[{"type":"too_many_buckets_exception","reason":"Trying to create too many buckets. Must be less than or equal to: [10000] but was [10001]. This limit can be set by changing the [search.max_buckets] cluster level setting.","max_buckets":10000}],"type":"search_phase_execution_exception","reason":"all shards failed","phase":"query","grouped":true,"failed_shards":[{"shard":0,"index":"datahub_datasetindex_v2_1656325420723","node":"lvOhAjVGQh-HO97e1HpyDg","reason":{"type":"too_many_buckets_exception","reason":"Trying to create too many buckets. Must be less than or equal to: [10000] but was [10001]. This limit can be set by changing the [search.max_buckets] cluster level setting.","max_buckets":10000}}]},"status":503}
at org.elasticsearch.client.RestClient.convertResponse(RestClient.java:302)
at org.elasticsearch.client.RestClient.performRequest(RestClient.java:272)
at org.elasticsearch.client.RestClient.performRequest(RestClient.java:246)
at org.elasticsearch.client.RestHighLevelClient.internalPerformRequest(RestHighLevelClient.java:1613)
... 10 common frames omitted
I believe this is not related to specific DataHub version but we use 0.8.38 and ES version 7.8.1. Maybe we need to change the way we query ES through GraphQL, seems like the queries are not so efficient.happy-orange-71237
10/20/2022, 12:58 PMbig-carpet-38439
10/28/2022, 3:10 AMbig-carpet-38439
10/28/2022, 3:12 AMmax_buckets for your elastic instance, we've also seen this work!big-carpet-38439
10/28/2022, 3:14 AM