【第七章】Structured Streaming

结构化数据流,相当于不断增加的无界表

两种处理模式

  • 微批处理
  • 持续处理

Structured Streaming和Spark SQL、Spark Streaming 关系

  • 数据抽象不同

编程

  1. 导入pyspark模块
  1. 创建SparkSession对象
  1. 建立输入数据源
  1. 定义流计算过程
  1. 启动流计算并输出结果

输入源

File源

Kafka源

Socket源

不适用

启动流计算

  1. format接收器类型
  1. outputMode输出模式 Append Complete Update
  1. queryName查询的名称,可选
  1. trigger 触发时间可选
Prev
【第六章】流计算
Next
【第八章】机器学习
Loading...
Article List
一个NotionNext搭建的博客
数据库系统概论
大数据原理与应用
javaWeb应用开发基础教程
python
毕业设计
大数据技术综合应用
实训-航空数据系统
java面向对象程序设计
数据结构
算法分析与设计
SPARK
Python爬虫大数据采集与挖掘
云计算
概率论与数理统计
数字逻辑
计算机网络
计算机组成原理
linux
操作系统
人工智能导论
数据仓库与数据挖掘
数据可视化
大数据安全与隐私保护
c语言
C++