logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

OpenAI 开源模型 gpt-oss 是在合成数据上训练的吗?一些合理推测

虽然 gpt-oss 模型的研发阵容尚未披露,模型卡片(model card)[9]也未详述预训练细节,但我确信 Sebastien Bubeck 参与了这个项目,且这些模型基于经过严格筛选或完全合成的数据集训练而成。梳理业界对每代 Phi 模型的评价可发现一个相同的模式:惊艳的测试分数[6],高涨的市场热情,但实际性能却远低于基准测试所显示的水平[7]。我们今天为大家带来的这篇文章,作者推测 O

文章图片
#开源#AI#人工智能
AI Agents 能自己开发工具自己使用吗?一项智能体自迭代能力研究

通过机器学习工程实现的自我改进轨迹,是由更优的算法、更纯净的数据和更高效率的内存使用驱动的 —— 即训练阶段的自我改进(training-time self-improvement)。作者发现,尽管两个模型都能创建出功能完备的工具集(GPT-5 偏向构建 Unix 风格的命令行工具,而 Opus 4 更注重拟人化的任务执行助手),但在真正执行复杂编程任务时,它们却几乎不使用这些自建工具,而是选择基

文章图片
#人工智能#AI
LLM 应用评估综合指南(多轮对话系统、RAG、AI Agent)

以 RAGAS 为例,它在衡量第一个指标(Answer Relevancy)时,很可能通过以下方式计算:向 LLM 提供问题、答案及检索到的上下文,要求其“评判该答案在 0-1 分范围内对问题的直接回应程度”,这个过程会返回一个原始的 0-1 分值,该分值可被用于计算整体平均值。我们今天为大家带来的文章,作者的观点是,对现代 LLM 应用的评估,必须超越传统的 NLP 评估指标,转向一个分场景、系

文章图片
#人工智能#AI#RAG
英伟达与 OpenAI、甲骨文:亦敌亦友的 AI 三角

就在英伟达创下业绩纪录的同时,他们最大的客户似乎正在悄悄武装自己,准备另起炉灶。我们今天为大家带来的这篇文章,作者的观点是:英伟达目前的高速增长依赖于激进的库存策略和宽松的信用条款,但其最大客户正通过定制芯片和直接采购关键组件来构建独立的供应链,这导致双方关系正从深度捆绑走向潜在的激烈竞争。[9],我推测其策略是:用英伟达 GPU 构建智能模型,但最终在自家的定制芯片上运行推理任务 —— 以此大幅

文章图片
#人工智能
为什么 AI Agent 重新爱上了文件系统(Filesystems)

大家开始编写 aboutme.md 文件,来充当可移植的身份描述 —— 你的偏好、你的技能、你的工作风格,全都放在一个文件里,这个文件可以在不同应用间流转,无需任何人去对接 API。而是说:你的数据、你的上下文、你的偏好、你的技能、你的记忆 —— 以一种你拥有的格式存在着,任何智能体都能读取,不会被锁死在某个特定的应用里。他指出,Claude Code 之所以有效,是因为它运行在你的电脑上,使用你

文章图片
#人工智能#AI
科学的演变:从笛卡尔到生成式人工智能

本文主要介绍了科学的演变历史,从笛卡尔到生成式人工智能。文章探讨了数学在验证科学原理中的作用,并介绍了新机器学习工具如何验证新的科学。文中提到,将生成式人工智能与Excel或iPhone进行比较是低估了这一新技术的潜在影响。生成型人工智能的效果很可能相当于电学(electricity)或香农的信息论(Shannon’s Information Theory)。Generative AI will

文章图片
#人工智能
GPU深度学习性能的三驾马车:Tensor Core、内存带宽与内存层次结构

今天,我们为大家带来的这篇文章,作者的核心观点是:Tensor Core、内存带宽和内存层次结构是影响 GPU 深度学习性能的几个最关键因素。作者详细解析了矩阵乘法运算在深度学习中的重要性,以及 Tensor Core 如何通过特有的矩阵乘法计算单元极大地提升计算性能。同时,作者还分析了内存带宽对性能的制约作用,

文章图片
#深度学习#人工智能#transformer +2
联通DataOps和MLOps:将机器学习推理作为新的数据源

数据是AI开发生产的重要元素,在数据驱动的AI时代,割裂的DataOps和MLOps是否依然能满足企业数据挖掘和AI应用的需求?带着这个疑问,IDP和大家一起跟随资深AI从业者Debmalya Biswas的实践分享,一探“如何将DataOps嵌入到MLOps中”。

文章图片
#深度学习#人工智能#算法
LLM评估:通过7大指标监测并评估大语言模型的表现

如今,大模型及相关的生成式人工智能技术已经成为科技产业变革的新焦点,但大模型存在一些风险(容易产生偏见内容、虚假信息),其行为难以预测和控制。因此,如何持续监控和评估大模型行为以降低这些风险成为当下产学研各界的研究难点。本文作者通过分析 ChatGPT 在 35 天内对一组固定 prompt 的回答,探索了 7 组指标来评估 LLM 的行为变化。

文章图片
#语言模型#人工智能#自然语言处理 +1
探索将大语言模型用作推荐系统

编者按:目前大语言模型主要问答、对话等场景,进行被动回答。是否可以将大模型应用于推荐系统,进行主动推送呢?这篇文章回顾了可以将大模型作为推荐系统的理论基础,并重点描述了基于英文和阿拉伯语的购物数据集微调T5-large模型,探索将LLMs用作推荐系统的实践。同时本文还介绍了LLMs作为推荐系统的优点和缺点,并提出建议和可行的方向。以下是译文,Enjoy!

文章图片
#语言模型#自然语言处理#人工智能
    共 163 条
  • 1
  • 2
  • 3
  • 17
  • 请选择