최신Databricks Certified Data Engineer Professional Exam (Databricks-Certified-Data-Engineer-Professional Korean Version) - Databricks-Certified-Data-Engineer-Professional Korean무료샘플문제
데이터 엔지니어링 팀은 다음 코드를 유지 관리합니다.

이 코드가 논리적으로 올바른 결과를 생성하고 원본 테이블의 데이터가 중복 제거 및 유효성 검사를 거쳤다고 가정할 때, 이 코드가 실행될 때 발생하는 상황을 설명하는 문장은 무엇입니까?
필요한 모듈을 찾을 때 검색할 디렉터리 목록을 담고 있는 파이썬 변수는 무엇입니까?
데이터 과학 팀은 MLflow를 사용하여 프로덕션 모델을 생성하고 로그에 기록했습니다. 다음 코드는 프로덕션 모델을 올바르게 가져와 적용하여 "customer_id LONG, predictions DOUBLE, date DATE" 스키마를 가진 preds라는 새 DataFrame으로 예측 결과를 출력합니다.

데이터 과학 팀은 예측 결과를 Delta Lake 테이블에 저장하고, 시간 경과에 따른 모든 예측 결과를 비교할 수 있기를 원합니다. 고객 이탈 예측은 하루에 최대 한 번만 수행됩니다.
어떤 코드 블록이 잠재적인 컴퓨팅 비용을 최소화하면서 이 작업을 수행합니까?
데이터 엔지니어가 타사에서 제공하는 REST API 엔드포인트에서 여러 보고서 유형을 지정하여 여러 PDF 파일을 다운로드하는 작업을 구현하고 있습니다. 해당 REST API는 시간이 오래 걸리고 간헐적으로 오류가 발생하므로, 엔지니어는 다운로드 활동을 추적하여 실패 시점을 파악하고 부분적으로 재시도하는 동시에 확장 가능한 처리량을 확보하고자 합니다. 엔지니어는 10가지 보고서 유형을 다운로드해야 하며, 보고서 유형 목록은 시간이 지남에 따라 변경될 수 있습니다. 데이터 엔지니어는 어떻게 이 작업을 수행해야 할까요?
데이터 엔지니어는 각 주식 그룹 내 행 간 상태를 유지해야 하는 복잡한 계산을 포함하는 금융 시계열 데이터를 처리하는 Pandas 사용자 정의 함수(UDF)를 설계하면서 함수의 효율성과 확장성을 보장해야 합니다. 데이터 무결성을 유지하면서 최소한의 오버헤드로 이 문제를 해결할 수 있는 접근 방식은 무엇일까요?
데이터 설계자는 레이크하우스의 모든 테이블을 외부 Delta Lake 테이블로 구성해야 한다고 지시했습니다.
어떤 접근 방식이 이 요구 사항을 충족시킬 수 있을까요?
데이터 엔지니어링 팀의 주니어 멤버가 Databricks 노트북의 언어 상호 운용성을 탐색하고 있습니다. 아래 코드의 목표는 geo_lookup 테이블에 있는 아프리카 대륙 국가에서 발생한 모든 판매 내역을 표시하는 것입니다.
코드를 실행하기 전에 현재 데이터베이스에서 SHOW TABLES 명령을 실행하면 데이터베이스에 geo_lookup과 sales라는 두 개의 테이블만 있는 것으로 나타납니다.

대화형 노트북에서 이러한 명령 셀을 순서대로 실행했을 때의 결과를 올바르게 설명하는 문장은 무엇입니까?
다중 작업에서 태스크로 실행되도록 구성된 노트북을 검토하는 데 사용할 수 있는 REST API 호출은 무엇입니까?
Spark 작업이 예상보다 오래 걸리고 있습니다. 데이터 엔지니어는 Spark UI를 사용하여 특정 단계의 작업에 대한 최소, 중앙값 및 최대 소요 시간을 확인했는데, 최소 및 중앙값 소요 시간은 거의 같지만 최대 소요 시간은 최소 소요 시간의 약 100배에 달하는 것을 발견했습니다.
전체 작업 시간 증가를 유발하는 상황은 무엇입니까?
데이터 엔지니어인 사용자 A는 REST API를 사용하여 여러 작업을 프로그래밍 방식으로 생성함으로써 새로운 파이프라인을 프로덕션 환경으로 배포했습니다. DevOps 엔지니어인 사용자 B는 외부 오케스트레이션 도구를 구성하여 REST API를 통해 작업 실행을 트리거하도록 설정했습니다. 두 사용자 모두 개인 액세스 토큰을 사용하여 REST API 호출을 승인했습니다.
다음 중 해당 이벤트와 관련된 작업 공간 감사 로그의 내용을 설명하는 문장은 무엇입니까?