MS_DotNetForApacheSparkSQL - NetDevInfraWGinOSSConsortium/NetDevInfraWiki GitHub Wiki
- 戻る(.NET for Apache Spark)
- .NET for Apache Sparkチュートリアル
- .NET for Apache Sparkのデータ接続
- .NET for Apache SparkのSQL
Spark SQL を、.NET for Apache Spark で書く。
(Spark SQL の一般的な説明は
Spark SQL を参照)
Column arrayCol = Split(lines.Col("value"), " ");
DataFrame df = null;
df = lines.WithColumn("col1", arrayCol.GetItem(0));
df = df.WithColumn("col2", arrayCol.GetItem(1));
df = df.WithColumn("col3", arrayCol.GetItem(2));補足(
Splitは静的インポート): 上記のSplitは
Microsoft.Spark.Sql.Functionsの静的メソッドで、
using static Microsoft.Spark.Sql.Functions;を書いた前提のコードである。
書かない場合はFunctions.Split(...)と修飾する。
なお、arrayColをWithColumnで 3 回展開しているが、
区切りが 3 個に満たない行ではGetItemがnullを返す点に注意する
(エラーにはならない。
チュートリアルの
「出力にnullの行が並ぶ理由」も参照)。
移行メモ(未記述): 「集計」の節は元ページでも見出しのみで、
本文が書かれていない。原文のまま残す。
Tags: クラウド, Azure, .NET開発, .NET Core, .NET Standard