logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

向量数据库(第 2 部分):了解其内部结构

需要记住的是,底层向量的维度越低,嵌入空间中的表示就越紧凑,这可能会影响下游任务的质量。与在数据库中的每个向量之间进行详尽比较不同,近似搜索会寻找最近邻,从而在结果的准确性上有一定的损失(可能并不总是返回真正的最近邻),但使用ANN算法可以获得巨大的性能提升。这是关于向量数据库的系列文章中的第二篇。正如本系列的第一篇所提到的,2023年上半年关于向量数据库的营销(不幸的是,有些是炒作)非常多,如果

文章图片
#数据库#大数据
向量数据库(第 3 部分):并非所有索引都是一样的

这是我关于向量数据库的系列文章的第三篇。第一部分比较了各种数据库供应商的产品以及它们在高层面上的区别,而第二部分则着重介绍了向量数据库的基础知识和功能。您可能已经阅读过Dmitry Kan在2021年撰写的优秀文章《并非所有向量数据库都是相同的》1,该文章涵盖了市场上各种向量数据库之间的差异。自那时以来,这个领域一直在不断发展,因为每个数据库在其内部都与其他数据库不同,所以我认为深入探讨索引是有意

文章图片
#数据库
揭秘数据库、数据仓库、数据湖和数据湖之家

不同原生格式(如 JSON、文本、二进制、图像、视频等)的大量数据可以存储在 DL 中,并仅在需要处理数据时在读取时转换为特定模式。另一方面,如果由于缺乏数据质量检查或治理而摄入的大部分数据质量较低,这种灵活性可能会成为一个缺点,从而使深度学习成为“数据沼泽”。DLH 比 DW 更灵活,可以根据需要在写入或读取时使用架构,但具有更严格的数据质量检查和元数据管理机制(也称为数据治理)。与 RDBMS

文章图片
#数据库#数据仓库
Nocalhost - 让云原生时代的开发更高效

三者比较来看Nocalhost是特性最多,支持的场景最多,支持IDE的插件最多,并且用户体验最好。完胜其他两位,是其他两个工具支持特性的超集,因此我们选择了Nocalhost,让基于云原生的开发更高效。...

文章图片
#kubernetes#容器#云原生
PostgreSQL 作为向量数据库:入门和扩展

本指南将深入研究该特定模式在应用程序中的实现。然而,由于搜索是近似的,搜索的召回率可能不是 100% 相关/准确,因为索引仅遍历数据的子集。它允许您存储和处理具有数千个维度的向量,计算向量化数据之间的欧几里德距离和余弦距离,并执行精确和近似最近邻搜索。为了在数据量和流量不断增加的情况下保持 Postgres 的性能和可扩展性,您可以使用矢量化数据的专用索引和/或使用Postgres 的分布式版本水

文章图片
#数据库#postgresql
如何在 .NET Core 中使用 Azure Key Vaul

Azure Key Vault提供了一个安全、可靠的集中存储秘密的地方,并具有强大的访问控制,消除了开发人员直接在应用程序中管理敏感数据的需求。通过Azure Key Vault,您可以集中管理密钥和秘密,提高应用程序的安全性和行业合规性,并简化敏感数据的管理和保护。在创建SecretClient的实例时,还应该指定KeyVault URI,如下面给出的代码片段所示。Azure Key Vault

文章图片
#.netcore#azure#flask
PostgreSQL 作为向量数据库:入门和扩展

本指南将深入研究该特定模式在应用程序中的实现。然而,由于搜索是近似的,搜索的召回率可能不是 100% 相关/准确,因为索引仅遍历数据的子集。它允许您存储和处理具有数千个维度的向量,计算向量化数据之间的欧几里德距离和余弦距离,并执行精确和近似最近邻搜索。为了在数据量和流量不断增加的情况下保持 Postgres 的性能和可扩展性,您可以使用矢量化数据的专用索引和/或使用Postgres 的分布式版本水

文章图片
#数据库#postgresql
如果你想从事人工智能职业,学习Python吧

人工智能并不会抢走你的工作,至少目前还不会。人工智能和机器学习(AI/ML)最好的应用是补充人类的创造力,而不是取代它。具有讽刺意味的是,最好的大型语言模型(LLMs)可能是通过使用受版权保护的人类创造力的作品(或许并不总是合法地)进行训练的。在可预见的未来,人类和机器人将和平共处。尽管如此,有些行业在采用人工智能方面比其他行业更为积极,这一点在斯坦福人类中心人工智能研究所发布的最新2022 AI

文章图片
#人工智能#大数据#机器学习 +1
到底了