- Create virtual environment (
.venv) for the project. - Install pyspark to the virtual environment using
pip install pyspark
spark_df = spark.read
.format("csv")
.option("header", "true")
.option("inferSchema, "true")
.load("/databricks-datasets/learning-spark-v2/sf-fire/sf-fire-calls.csv")
spark_df = spark.read
.csv("/databricks-datasets/learning-spark-v2/sf-fire/sf-fire-calls.csv",
header="true",
inferSchema="true")
spark_df.createGlobalTempView("fire_service_calls_view")
With this view, we can run Sql queries such as
select * from global_temp.fire_service_calls_view
create database if not exists demo_db
create table if not exists demo_db.fire_service_calls_tbl(
CallNumber integer,
UnitID string,
IncidentNumber integer,
CallType: string
) using parquet
insert into demo_db.fire_service_calls_tbl
values(1234, null, null, null)
select * from demo_db.fire_service_calls_tbl
