我正在使用CDH 5.16
,其中有Spark 1.6.0
,scala 2.10.5
和java 1.8
。
我试图通过使用FAT jar
从本地系统创建sbt
来运行Spark代码。
但是当我在集群上运行spark提交时,出现以下错误:
Exception in thread "main" java.lang.NoSuchMethodError: scala.reflect.api.JavaUniverse.runtimeMirror(Ljava/lang/ClassLoader;)Lscala/reflect/api/JavaUniverse$JavaMirror;
at salesSample$.main(salesSample.scala:24)
at salesSample.main(salesSample.scala)
at sun.reflect.NativeMethodAccessorImpl.invoke0(Native Method)
at sun.reflect.NativeMethodAccessorImpl.invoke(NativeMethodAccessorImpl.java:62)
at sun.reflect.DelegatingMethodAccessorImpl.invoke(DelegatingMethodAccessorImpl.java:43)
at java.lang.reflect.Method.invoke(Method.java:498)
at org.apache.spark.deploy.SparkSubmit$.org$apache$spark$deploy$SparkSubmit$$runMain(SparkSubmit.scala:730)
at org.apache.spark.deploy.SparkSubmit$.doRunMain$1(SparkSubmit.scala:181)
at org.apache.spark.deploy.SparkSubmit$.submit(SparkSubmit.scala:206)
at org.apache.spark.deploy.SparkSubmit$.main(SparkSubmit.scala:121)
at org.apache.spark.deploy.SparkSubmit.main(SparkSubmit.scala)
我的spark代码非常简单,如下所示:
import org.apache.spark.SparkContext
import org.apache.spark.SparkConf
import org.apache.spark.sql.SQLContext
import org.apache.spark.sql.types._
import org.apache.spark.sql.{SQLContext,SaveMode}
case class categories_schema(CategoryID: String, CategoryName: String, Description: String )
case class products_schema(ProductID: String, CategoryID: String, ProductName: String, SupplierID: String)
object salesSample {
def main(args: Array[String]){
val conf:SparkConf = new SparkConf().setAppName("salessample").setMaster("local")
val sc:SparkContext = new SparkContext(conf)
val sqlContext = new SQLContext(sc)
import sqlContext.implicits._
val categories_data = sc.textFile("hdfs://url/user/ak_bng/categories").map(_.split(",")).map(p => categories_schema(p(0),p(1),p(2))).toDF()
val product_data=sc.textFile("hdfs://url/user/ak_bng/products").map(_.split(",")).map( p=> products_schema(p(0),p(1),p(2),p(3))).toDF()
categories_data.registerTempTable("categories_data")
product_data.registerTempTable("product_data")
val prod_order_sql="""select distinct p.ProductID,p.ProductName,c.categoryname,
oh.OrderDate,oh.Freight,oh.OrderID,oh.ShipperID,
od.Quantity,od.Sales,Discount,od.COS,od.GP,p.CategoryID,
oh.Updated_time as oh_Updated_time,od.Updated_time as od_Updated_time
from prod p
inner join ordrd od on p.productID=od.productID
inner join ordrh oh on od.OrderID=oh.OrderID
inner join cat c on c.categoryID=p.categoryID
"""
categories_data.write.mode(SaveMode.Overwrite).parquet("hdfs://url/user/hive/warehouse/product_order_temp2")
sc.stop()
}
}
我以前在同一RHEl服务器上安装了Hadoop独立服务器,并且能够通过SBT执行jar构建。
在谷歌搜索时,我发现这是一个版本问题。我已经纠正了它们,但仍然无法弄清楚问题出在哪里。
下面是我的build.sbt
文件的内容:
name := "Simple_Project"
version := "1.0"
scalaVersion := "2.10.6"
libraryDependencies += "org.apache.spark" %% "spark-core" % "1.6.0" % "provided"
libraryDependencies += "org.apache.spark" %% "spark-streaming" % "1.6.0" % "provided"
libraryDependencies += "org.apache.spark" %% "spark-streaming-kinesis-asl" % "1.6.0"
libraryDependencies += "org.apache.spark" %% "spark-sql" % "1.6.0" % "provided"
assemblyMergeStrategy in assembly := {
case PathList("META-INF", xs @ _*) => MergeStrategy.discard
case x => MergeStrategy.first
}
我尝试将Scala
的版本更改为2.10.0
,2.10.5
和2.10.6
。
所有结果都相同。
以下是我的plugin.sbt
文件内容:
addSbtPlugin("com.eed3si9n" % "sbt-assembly" % "0.14.6")
addSbtPlugin("com.typesafe.sbteclipse" % "sbteclipse-plugin" % "5.2.4")
我正在使用Scala IDE
编写代码。
有人可以帮我弄清楚这里是什么问题。
答案 0 :(得分:0)
最终解决了这个问题。似乎即使在.sbt
文件中更改了scala的版本也未更改。在target
文件夹中,将在其中创建组装后的jar
文件的文件夹仍命名为2.11
而不是2.10
。
因此,我使用相同的火花代码创建了一个新的sbt
项目,对其进行了编译,并重新创建了eclipse
文件(我正在使用scala ide
),然后对其进行了组装。新的jar
现在可以正常工作。