<?xml version="1.0" encoding="UTF-8"?>
<rss xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/" xmlns:rdf="http://www.w3.org/1999/02/22-rdf-syntax-ns#" xmlns:taxo="http://purl.org/rss/1.0/modules/taxonomy/" version="2.0">
  <channel>
    <title>topic NoteBook PySpark Question from a newbie (Applying data from anthoer Dataframe in notebook) in Data Warehouse</title>
    <link>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4054505#M1268</link>
    <description>&lt;P&gt;I'm probably going to have a series of questions like this!!&amp;nbsp; I'm going to baby Step this.&amp;nbsp; The 50,000 foot view of what I'm trying to do is, I have 524 files that I need to load into a Fabric Warehouse everyday. The csv files themselves do not have headers on them. I have figured out how to get the header I need.&amp;nbsp; One of those files contains the buisness Date of the Data. I want to grab the date from that one file and then for all of the over files I wanted to add that Data as a column For Example:&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;File1 (I was able to Load it as a Data Frame) and rename the columns. I need the 3rd column&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;AA&lt;/TD&gt;&lt;TD&gt;20240721&lt;/TD&gt;&lt;TD&gt;20240719&lt;/TD&gt;&lt;TD&gt;20240721&lt;/TD&gt;&lt;TD&gt;20240719&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;File 2-524&amp;nbsp; (Files with various columns and number of records, I have the meta data for each file)&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;XXXXX&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;324&lt;/TD&gt;&lt;TD&gt;cde&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;XXXXV&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdf&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;&lt;P&gt;XXXXH&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdd&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;OutputResult (Want to add a column to the Beginning with the Date From File1 as a Date (That value is loading as a scring)&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;BusinessEffectiveDate&lt;/TD&gt;&lt;TD&gt;Field1&lt;/TD&gt;&lt;TD&gt;Field2&lt;/TD&gt;&lt;TD&gt;Field3&lt;/TD&gt;&lt;TD&gt;Field4&lt;/TD&gt;&lt;TD&gt;Field5&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&lt;/TD&gt;&lt;TD&gt;XXXXX&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;324&lt;/TD&gt;&lt;TD&gt;cde&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&lt;/TD&gt;&lt;TD&gt;XXXXV&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdf&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&lt;/TD&gt;&lt;TD&gt;&lt;P&gt;XXXXH&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdd&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;I tried to keep it simple. So I'm trying to pull field 3 in File one that the data is in yyyymmdd format and then use that date and add it to all the other files as the first field.&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp;Some code that I have been playing with. I can load the file and rename the columns, but could not figureout how to extract the column and then use it on the other tables.&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;functools&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;reduce&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;pyspark.sql&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;functions&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;as&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;F&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;pyspark.sql&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;types&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;as&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;T&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;df = spark.read.csv(&lt;/SPAN&gt;&lt;SPAN&gt;"Files/Development/PersistentStaging/McCrackenDaily/PBATCHCT"&lt;/SPAN&gt;&lt;SPAN&gt;)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;df_pnote = spark.read.csv(&lt;/SPAN&gt;&lt;SPAN&gt;"Files/Development/PersistentStaging/McCrackenDaily/PNOTES"&lt;/SPAN&gt;&lt;SPAN&gt;)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;# df now is a Spark DataFrame containing CSV data from "Files/Development/PersistentStaging/McCrackenDaily/PNOTES_DFN.csv".&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;oldColumns = df.schema.names&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;newColumns = [&lt;/SPAN&gt;&lt;SPAN&gt;"BGAAKY"&lt;/SPAN&gt;&lt;SPAN&gt;,&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;"BGBTDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGBGDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGETDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGEGDT"&lt;/SPAN&gt;&lt;SPAN&gt;]&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;df=&lt;/SPAN&gt;&lt;SPAN&gt;reduce&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;lambda&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;df&lt;/SPAN&gt;&lt;SPAN&gt;,&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;idx&lt;/SPAN&gt;&lt;SPAN&gt;: df.withColumnRenamed(oldColumns[idx], newColumns[idx]),&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;range&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;len&lt;/SPAN&gt;&lt;SPAN&gt;(oldColumns)), df)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;display(df.printSchema)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;def&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;clean_data&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;df&lt;/SPAN&gt;&lt;SPAN&gt;&lt;span class="lia-unicode-emoji" title=":disappointed_face:"&gt;😞&lt;/span&gt;&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;# Derive column 'BusinessEffectiveDate' from column: 'BGBGDT'&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;#df = df.withColumn('BusinessEffectiveDate', F.lit(None).cast(T.DateType StringType()))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp; df = df.withColumn(&lt;/SPAN&gt;&lt;SPAN&gt;'BusinessEffectiveDate'&lt;/SPAN&gt;&lt;SPAN&gt;, F.lit(&lt;/SPAN&gt;&lt;SPAN&gt;None&lt;/SPAN&gt;&lt;SPAN&gt;).cast(T.DateType()))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;# &amp;nbsp;df = df.select(*(df.columns[:3] + 'BusinessEffectiveDate' + df.columns[3:]))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;return&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;df&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;df_clean = clean_data(df)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;display(df_clean)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;/DIV&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;</description>
    <pubDate>Mon, 22 Jul 2024 19:00:33 GMT</pubDate>
    <dc:creator>dnauflett</dc:creator>
    <dc:date>2024-07-22T19:00:33Z</dc:date>
    <item>
      <title>NoteBook PySpark Question from a newbie (Applying data from anthoer Dataframe in notebook)</title>
      <link>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4054505#M1268</link>
      <description>&lt;P&gt;I'm probably going to have a series of questions like this!!&amp;nbsp; I'm going to baby Step this.&amp;nbsp; The 50,000 foot view of what I'm trying to do is, I have 524 files that I need to load into a Fabric Warehouse everyday. The csv files themselves do not have headers on them. I have figured out how to get the header I need.&amp;nbsp; One of those files contains the buisness Date of the Data. I want to grab the date from that one file and then for all of the over files I wanted to add that Data as a column For Example:&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;File1 (I was able to Load it as a Data Frame) and rename the columns. I need the 3rd column&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;AA&lt;/TD&gt;&lt;TD&gt;20240721&lt;/TD&gt;&lt;TD&gt;20240719&lt;/TD&gt;&lt;TD&gt;20240721&lt;/TD&gt;&lt;TD&gt;20240719&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;File 2-524&amp;nbsp; (Files with various columns and number of records, I have the meta data for each file)&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;XXXXX&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;324&lt;/TD&gt;&lt;TD&gt;cde&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;XXXXV&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdf&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;&lt;P&gt;XXXXH&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdd&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;OutputResult (Want to add a column to the Beginning with the Date From File1 as a Date (That value is loading as a scring)&lt;/P&gt;&lt;TABLE border="1"&gt;&lt;TBODY&gt;&lt;TR&gt;&lt;TD&gt;BusinessEffectiveDate&lt;/TD&gt;&lt;TD&gt;Field1&lt;/TD&gt;&lt;TD&gt;Field2&lt;/TD&gt;&lt;TD&gt;Field3&lt;/TD&gt;&lt;TD&gt;Field4&lt;/TD&gt;&lt;TD&gt;Field5&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&lt;/TD&gt;&lt;TD&gt;XXXXX&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;324&lt;/TD&gt;&lt;TD&gt;cde&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&lt;/TD&gt;&lt;TD&gt;XXXXV&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdf&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;TR&gt;&lt;TD&gt;07-19-2024&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&amp;nbsp;&lt;/TD&gt;&lt;TD&gt;&lt;P&gt;XXXXH&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;/TD&gt;&lt;TD&gt;SomeData&lt;/TD&gt;&lt;TD&gt;234&lt;/TD&gt;&lt;TD&gt;cdd&lt;/TD&gt;&lt;TD&gt;2024&lt;/TD&gt;&lt;/TR&gt;&lt;/TBODY&gt;&lt;/TABLE&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;P&gt;I tried to keep it simple. So I'm trying to pull field 3 in File one that the data is in yyyymmdd format and then use that date and add it to all the other files as the first field.&lt;/P&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;&lt;DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp;Some code that I have been playing with. I can load the file and rename the columns, but could not figureout how to extract the column and then use it on the other tables.&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;functools&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;reduce&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;pyspark.sql&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;functions&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;as&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;F&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;from&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;pyspark.sql&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;import&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;types&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;as&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;T&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;df = spark.read.csv(&lt;/SPAN&gt;&lt;SPAN&gt;"Files/Development/PersistentStaging/McCrackenDaily/PBATCHCT"&lt;/SPAN&gt;&lt;SPAN&gt;)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;df_pnote = spark.read.csv(&lt;/SPAN&gt;&lt;SPAN&gt;"Files/Development/PersistentStaging/McCrackenDaily/PNOTES"&lt;/SPAN&gt;&lt;SPAN&gt;)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;# df now is a Spark DataFrame containing CSV data from "Files/Development/PersistentStaging/McCrackenDaily/PNOTES_DFN.csv".&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;oldColumns = df.schema.names&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;newColumns = [&lt;/SPAN&gt;&lt;SPAN&gt;"BGAAKY"&lt;/SPAN&gt;&lt;SPAN&gt;,&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;"BGBTDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGBGDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGETDT"&lt;/SPAN&gt;&lt;SPAN&gt;,&lt;/SPAN&gt;&lt;SPAN&gt;"BGEGDT"&lt;/SPAN&gt;&lt;SPAN&gt;]&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;df=&lt;/SPAN&gt;&lt;SPAN&gt;reduce&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;lambda&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;df&lt;/SPAN&gt;&lt;SPAN&gt;,&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;idx&lt;/SPAN&gt;&lt;SPAN&gt;: df.withColumnRenamed(oldColumns[idx], newColumns[idx]),&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;range&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;len&lt;/SPAN&gt;&lt;SPAN&gt;(oldColumns)), df)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;display(df.printSchema)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;def&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;clean_data&lt;/SPAN&gt;&lt;SPAN&gt;(&lt;/SPAN&gt;&lt;SPAN&gt;df&lt;/SPAN&gt;&lt;SPAN&gt;&lt;span class="lia-unicode-emoji" title=":disappointed_face:"&gt;😞&lt;/span&gt;&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;# Derive column 'BusinessEffectiveDate' from column: 'BGBGDT'&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;#df = df.withColumn('BusinessEffectiveDate', F.lit(None).cast(T.DateType StringType()))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp; df = df.withColumn(&lt;/SPAN&gt;&lt;SPAN&gt;'BusinessEffectiveDate'&lt;/SPAN&gt;&lt;SPAN&gt;, F.lit(&lt;/SPAN&gt;&lt;SPAN&gt;None&lt;/SPAN&gt;&lt;SPAN&gt;).cast(T.DateType()))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;# &amp;nbsp;df = df.select(*(df.columns[:3] + 'BusinessEffectiveDate' + df.columns[3:]))&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;&amp;nbsp; &amp;nbsp;&amp;nbsp;&lt;/SPAN&gt;&lt;SPAN&gt;return&lt;/SPAN&gt;&lt;SPAN&gt;&amp;nbsp;df&lt;/SPAN&gt;&lt;/DIV&gt;&lt;BR /&gt;&lt;DIV&gt;&lt;SPAN&gt;df_clean = clean_data(df)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;DIV&gt;&lt;SPAN&gt;display(df_clean)&lt;/SPAN&gt;&lt;/DIV&gt;&lt;/DIV&gt;&lt;P&gt;&amp;nbsp;&lt;/P&gt;</description>
      <pubDate>Mon, 22 Jul 2024 19:00:33 GMT</pubDate>
      <guid>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4054505#M1268</guid>
      <dc:creator>dnauflett</dc:creator>
      <dc:date>2024-07-22T19:00:33Z</dc:date>
    </item>
    <item>
      <title>Re: NoteBook PySpark Question from a newbie (Applying data from anthoer Dataframe in notebook)</title>
      <link>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4055703#M1270</link>
      <description>&lt;P&gt;Hi&amp;nbsp;&lt;a href="javascript:void(0)" data-lia-user-mentions="" data-lia-user-uid="630286" data-lia-user-login="dnauflett" class="lia-mention lia-mention-user"&gt;dnauflett&lt;/a&gt;,&lt;/P&gt;
&lt;P&gt;You can take a load at the following code to use df.collect and df.withColumn function to achieve your requirement:&lt;/P&gt;
&lt;P&gt;&amp;nbsp;&lt;/P&gt;
&lt;P&gt;&amp;nbsp;&lt;/P&gt;
&lt;LI-CODE lang="markup"&gt;# Import modules
from pyspark.sql import SparkSession
from pyspark.sql.functions import lit

# Create a sample DataFrame
data = [("A", 34), ("B", 45), ("C", 29)]
columns = ["Name", "Age"]
df = spark.createDataFrame(data, columns)
display(df)

# get cellvalue from DataFrame second row, first column
cellValue = df.collect()[1][0]

# load new data
df = spark.read.format("csv").option("header","true").load("Files/churn/raw/churn.csv")

# Add a new column lit wiht extract value
df = df.withColumn("NewColumn", lit(cellValue))

display(df)&lt;/LI-CODE&gt;
&lt;P&gt;&amp;nbsp;&lt;/P&gt;
&lt;P&gt;&amp;nbsp;&lt;/P&gt;
&lt;P&gt;&lt;img /&gt;&lt;/P&gt;
&lt;P&gt;&lt;A href="https://stackoverflow.com/questions/44174747/spark-dataframe-collect-vs-select" target="_blank" rel="noopener"&gt;Spark dataframe: collect () vs select () - Stack Overflow&lt;/A&gt;&lt;/P&gt;
&lt;P&gt;Regards,&lt;/P&gt;
&lt;P&gt;Xiaoxin Sheng&lt;/P&gt;</description>
      <pubDate>Tue, 23 Jul 2024 07:32:55 GMT</pubDate>
      <guid>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4055703#M1270</guid>
      <dc:creator>Anonymous</dc:creator>
      <dc:date>2024-07-23T07:32:55Z</dc:date>
    </item>
    <item>
      <title>Re: NoteBook PySpark Question from a newbie (Applying data from anthoer Dataframe in notebook)</title>
      <link>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4056182#M1275</link>
      <description>&lt;P&gt;Thanks you so much Xiaoxin!!!&amp;nbsp; You have really help advancing my knowledge and training of Pyspark&lt;/P&gt;</description>
      <pubDate>Tue, 23 Jul 2024 10:38:58 GMT</pubDate>
      <guid>https://community.fabric.microsoft.com/t5/Data-Warehouse/NoteBook-PySpark-Question-from-a-newbie-Applying-data-from/m-p/4056182#M1275</guid>
      <dc:creator>dnauflett</dc:creator>
      <dc:date>2024-07-23T10:38:58Z</dc:date>
    </item>
  </channel>
</rss>

