- Published on
2026년 7월 14일 릴리스된 Apache Spark 4.2.0은 SPARK-54555로 spark.sql.execution.pythonUDF.arrow.enabled 기본값을 false에서 true로 뒤집었습니다. 벤더 블로그는 이걸 "코드 재작성 없이 더 빠른 컬럼 경로"라고 소개하지만, 정작 릴리스 어디에도 Arrow 대 pickle의 속도 수치는 공개돼 있지 않습니다. 그리고 진짜 이야기는 속도가 아니라 타입 강제 변환입니다. Spark 저장소에 체크인된 골든 테이블 두 개를 실제로 diff해 보면 225칸 중 132칸이 달라지는데, 그중 99칸은 조용히 NULL이던 것이 이제 에러가 되고, 18칸은 아무 에러 없이 NULL이 실제 값으로 바뀝니다. 이 글은 무엇이 왜 바뀌었는지, 이 132칸을 카테고리별로 뜯어보고, UDF를 언제 만드느냐에 따라 최적화가 조용히 꺼지는 import 순서 함정까지 1차 자료로 확인한 내용만 정리합니다.