logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

什么是Lance & LanceDB AI 多模态数据库

LanceDB是一种面向AI时代的新型数据库系统,专为处理大规模多模态数据而设计。其核心创新在于自主研发的Lance数据格式,相比传统Parquet格式,在随机访问速度上提升100倍,并能高效处理图像、视频、文本等非结构化数据。LanceDB通过三层架构实现:底层文件存储、数据湖管理和应用层接入,支持单机SDK和分布式引擎访问。主要优势包括:1)同时满足快速扫描、随机访问和大数据块处理三大需求;2

#人工智能#大数据
开源报表 Davinci 详细介绍

Davinci介绍:Davinci是一个DVAAS(Data Visualization as a Service)平台解决方案。Davinci面向业务人员/数据工程师/数据分析师/数据科学家,致力于提供一站式数据可视化解决方案。既可作为公有云/私有云独立使用,也可作为可视化插件集成到三方系统。用户只需在可视化UI上简单配置即可服务多种数据可视化应用,并支持高级交互/行业分析/模式探索/社交智能等

机器学习:数据预处理之独热编码(One-Hot)详解

一. 什么是独热编码?————————————————————————————————————————在机器学习算法中,我们经常会遇到分类特征,例如:人的性别有男女,祖国有中国,美国,法国等。这些特征值并不是连续的,而是离散的,无序的。通常我们需要对其进行特征数字化。那什么是特征数字化呢?例子如下:性别特征:["男","女"]祖国特征:["中国","美国,"法国"...

#机器学习
机器学习与深度学习资料整理

《Brief History of Machine Learning》介绍:这是一篇介绍机器学习历史的文章,介绍很全面,从感知机、神经网络、决策树、SVM、Adaboost到随机森林、Deep Learning.《Deep Learning in Neural Networks: An Overview》介绍:这是瑞士人工智能实验室Jurgen Schmidhuber写的最新版本《神经网络与深度学

#机器学习
git pull报“unable to update local ref”解决方式

使用git pull拉取代码的时候,无法拉取最新代码,报"unable to update local ref"错误。除了重新clone一份代码外,还可以使用如下解决方案:1、切换到之前clone代码目录下,执行命令git gc --prune=now或者git gc2、再执行命令git pull3、有问题再执行后再做pull操作git rem...

#开发工具
TortoiseGit git ssh 配置 详细步骤

1、安装界面化管理工具“TortoiseGit”。全部默认选择,完成安装。 2. 安装“TortoiseGit”的中文语言包。一步即可完成安装。3. 随便进入一个文件夹,鼠标右键进行设置。右键->TortoiseGit(T)->设置, 进入设置页面。  4. 在设置页面中,点击“常规设置”然后单击“重新运行首次启动向导”。 5. 在向导界面,所有选项一直...

#git
机器学习与深度学习资料整理

《Brief History of Machine Learning》介绍:这是一篇介绍机器学习历史的文章,介绍很全面,从感知机、神经网络、决策树、SVM、Adaboost到随机森林、Deep Learning.《Deep Learning in Neural Networks: An Overview》介绍:这是瑞士人工智能实验室Jurgen Schmidhuber写的最新版本《神经网络与深度学

#机器学习
spark常见错误及调优

一. 运维1. Master挂掉,standby重启也失效Master默认使用512M内存,当集群中运行的任务特别多时,就会挂掉,原因是master会读取每个task的event log日志去生成spark ui,内存不足自然会OOM,可以在master的运行日志中看到,通过HA启动的master自然也会因为这个原因失败。解决增加Master的内存占用,在M

#spark
maven-shade-plugin relocation解决包冲突(spark udf okhttp3 okio包冲突问题解决)

maven-shade-plugin中提供了一个Relocating(迁移)的功能,通过将原来包下的类迁移到我们指定的包名下。和okio的包删除,使用我们自己打的包。启动后发现可以,但是这肯定会导致集群用这两个包时报错。经过排查,发现大数据集群中依赖了okhttp和okio的包,而集群中也有okhttp和okio的包。如下图所示,就将okio和okhttp3包移到了我们制定的shaded目录下。剔

文章图片
#spark#大数据#分布式 +1
spark-sql 多表关联( union all) TaskMemoryManager: Failed to allocate a page (8388608 bytes)

如果资源充足那就需要增加driver内存和调整spark.sql.autoBroadcastJoinThreshold内存,可以根据需要开启spark.broadcast.compress=true。因为spark.sql.adaptive.enabled=true开启自动调优,spark.sql.autoBroadcastJoinThreshold=2G。在使用多表关联的时候慎重开启spark.

文章图片
#spark#sql#大数据
    共 89 条
  • 1
  • 2
  • 3
  • 9
  • 请选择