登录社区云,与社区用户共同成长
邀请您加入社区
本文详细介绍了OpenAI Codex的安装与配置教程。首先通过npm安装最新版Codex,然后创建配置文件目录及config.toml文件进行参数设置,接着配置auth.json文件添加API密钥。最后通过命令行测试验证配置是否成功,帮助读者在自己的项目中顺利使用Codex进行AI编程。
本文详细对比了GPT和BERT两大NLP基石模型:GPT作为单向解码器擅长文本生成,适用于创作、对话等场景;BERT作为双向编码器擅长文本理解,适用于分类、问答等任务。两者虽基于Transformer架构,但核心设计与应用场景根本不同。文章还介绍了结合两者优势的RAG技术,强调BERT在AI协作中仍是不可或缺的"基石"模型。
本文档旨在作为理解大语言模型(LLM)后训练基础的指南,涵盖了从预训练模型到指令微调模型的完整流程。从“下一个token预测”到“指令遵循”的转变过程有监督微调(Supervised Fine-Tuning, SFT)基础,包括数据集构建与损失函数各类强化学习技术(RLHF、RLAIF、RLVR)及奖励模型的详细解析用于评估模型质量的评估方法。
摘要:本文介绍了如何在自己的电脑上拆解大语言模型(LLM)的"思考"过程。通过搭建虚拟环境,加载轻量级模型DistilBERT,提取隐藏状态并可视化神经元激活模式,揭示LLM如何编码情感、语义和类比关系。从区分正负面情感到比较相似句子的语义差异,再到用PCA分析词语类比关系,逐步展示了LLM内部工作机制。只需8GB内存和Python环境,就能探索这个AI黑箱,为理解语言模型提供
《大语言模型(LLM)入门指南》是一篇面向非技术人员的科普文章,通过8个章节循序渐进地讲解LLM的核心原理:1)从线性回归引入模型训练概念;2)分类问题的处理方法;3)神经网络的设计原理;4)LLM的本质是自回归预测;5)预训练的海量数据需求;6)后训练中的对话调优;7)推理能力的培养方法;8)Agent功能的实现机制。文章采用生活化比喻,避开数学公式,强调LLM依赖数据质量的特性,并附赠104G
本文对比了大模型Agent的两种实现技术流派:流程智能化(如Coze)强调确定性流程编排,智能体智能化(如DeerFlow)注重自主决策能力。文章提出通过规划与反思、工具使用和记忆机制三个核心模块实现两种范式的融合,构建混合智能架构。最后展望了Agent在AI浏览器、ChatBot、工作流自动化等领域的应用新形态,为开发者提供了全面的Agent设计与实现指南。
摘要: AI大模型Agent是否仅是Prompt工程的争论持续发酵。一方认为Agent本质是Prompt的排列组合,强调精巧的文本设计;另一方则指出企业级Agent需集成任务调度、状态管理等系统工程。技术专家提出Agent公式:LLM+计划+执行+反馈,强调状态管理是关键。争论揭示了技术发展的阶段性——从初级Prompt工程到高级系统架构的演进。结论认为,Agent既是语言艺术,更是系统工程,需要
本文以大语言模型(LLM)为"预制菜"的类比,系统阐述了AI产业的范式转变。文章从标准化生产(预训练、数据处理、模型架构)、便捷消费(提示词工程、微调、RAG技术)两方面,解析了LLM如何实现智能能力的规模化生产与快速交付。同时指出当前存在的黑盒性、领域知识局限等挑战,并展望了从"预制菜"向"智能中央厨房"进化的未来趋势,即构建动态生态系
2026年AI校招趋势深度解析:高薪赛道、行业需求与人才竞争新逻辑
AI Agent作为能规划和执行多步骤任务的自主行为者正在崛起,成为GenAI应用的核心抽象。当前分为手工制作、专业化和通用三类,已在电子表格、营销自动化等领域展现价值。为支持Agent发展,新的基础设施生态系统正在形成,包括专用开发工具、Agent即服务、浏览器基础设施、个性化内存、身份验证解决方案以及托管编排平台,帮助开发者构建更强大、可扩展的AI Agent应用。
摘要:本研究针对大型语言模型(LLMs)在金融交易领域的应用空白,开发了StockBench基准测试系统。该系统模拟真实股票交易环境,包含2025年3-6月的历史市场数据、基本面和新闻信息,评估了GPT-5、Claude-4、Qwen3等主流模型作为交易智能体的表现。研究发现,尽管多数模型难以超越简单的买入持有策略,但Kimi-K2等模型展现出较好的风险调整收益能力。研究还揭示了信息源重要性和投资
本文介绍了一种革命性的零代码RAG智能体构建方法,通过n8n和Pinecone Assistant组合,将传统11步复杂流程简化为5步操作,大幅降低技术门槛。文章详细解析了技术架构、知识管理、云原生基础设施等核心模块,提供16分钟快速实施的完整指南,并客观分析了国产替代的现实差距,为AI开发者提供了实用参考。
文章分析了AI产业从关注模型性能向关注落地和商业化的转变趋势。详细介绍了AI产业链的上游(基础层)、中游(模型/平台层)和下游(应用层),并探讨了大模型收费模式、具身智能以及AI陪伴和教育等赛道的商业化前景。作者强调,未来AI竞争的关键在于将技术想法快速转化为商业价值,形成生态闭环。---
文章介绍了AI从"语言模型"向"智能体(Agent)"进化的新范式,核心驱动力是智能体强化学习(Agentic RL)。这种强化学习赋能智能体六大核心能力:规划、工具使用、记忆、推理、自我改进和感知,使其能在动态环境中自主决策、采取行动。Agentic RL正在各专业领域催生能力更强的专用智能体,展现出巨大应用潜力,但也面临可信赖性、训练规模化和环境规模化等挑战。
本文探讨了AI Agent作为继移动互联网后的"iPhone时刻",如何重塑产品经理的工作方式。文章解析了AI Agent作为"个人CEO"的意图驱动范式,强调产品经理需从界面设计转向服务设计。同时分析了"神"与"管家"的权衡战略,以及Agent如何重构流量、商业模式和指标体系。最后提供行动指南,帮助产品经理在Agent时代实现思维转变,从"产品即目的地"转向"产品即能力",抢占未来数字世界的战略
文章详解了人工智能(AI)、机器学习(ML)、深度学习(DL)和ChatGPT的层级关系:AI是广泛领域,目标是创造智能体;ML是实现AI的主要方法,从数据中学习规律;DL是ML的子集,使用深度神经网络处理非结构化数据;ChatGPT是DL的具体应用,基于Transformer架构的大型语言模型。通过自动驾驶类比帮助理解这种从目标到方法再到应用的层级关系,为学习大模型提供清晰路径。
多模态大语言模型(MLLMs)是AI领域的重要突破,能同时处理文本、图像、音频等多种模态。本文系统分析了主流模型(如Flamingo、PaLI、GPT-4V)的技术架构、对齐方法、训练策略,展示了MLLMs在医疗、教育、工业等领域的应用潜力,并探讨了计算成本、语义鸿沟等挑战及未来发展趋势,为理解这一前沿技术提供了全面视角。
这个学习路线图适用于初学者和希望深入了解这个领域的人士。随着技术的不断发展,建议持续关注最新的趋势和研究成果。
一文读懂AI大模型训练全流程,从准备到落地清晰拆解!
Workflow方法在处理开放性问题时面临瓶颈,工作量指数级增长。相比固定的流程设计,AI Agent更适合处理复杂开放领域。大模型产品开发应从'固定流程'转向'弹性能力集合',迭代思维需从解决具体问题转变为赋予通用能力。选择Agent是将产品未来与大模型进化绑定,而非被当前技术局限。
本文深入解析了AI智能体(Agent)的核心原理与技术架构,强调其与传统AI的本质区别——具有自主性、目标导向和环境交互能力。文章详细介绍了AI Agent的五大核心能力:规划、记忆、工具调用、行动和反思,以及典型工业级实现架构。同时探讨了AI Agent在个人助理、企业服务和行业应用三大场景的落地价值,并分析了当前挑战与未来趋势。AI Agent不仅是"更聪明的聊天机器人",更是能够主动思考、行
本文详细介绍了AIGC的5层系统化学习路径:通识层建立基础认知,体验层掌握工具部署,应用层进行多领域创作实践,商业层探索变现模式,原理层深入技术核心。文章强调循序渐进、重点突破的学习方法,推荐各阶段学习资源,指出常见学习误区,帮助学习者系统掌握AIGC技术,实现从入门到精通的跨越。
别等被淘汰!国庆后学大模型:从应用全景到项目实战,全套资料帮你卡位 AI 风口
2025 年 AI Agent 怎么玩?技术体系、七大核心趋势与客户服务 / 数据分析场景落地方案
本文详细解读了AI智能体从实验室走向生产线的三大核心逻辑:体系化运营、科学评估和智能协作。文章系统介绍了AI智能体的架构组成(模型、工具、编排层)、运营方法论(工具管理、步骤追溯、持续优化)以及评估标准(基础能力、做事步骤、评分机制)。最后通过多智能体协同案例展示了AI智能体的落地应用价值,为企业和开发者提供了AI智能体实际部署的实用指南。
文章介绍了大语言模型应用的两种核心技术:提示词工程和上下文工程。提示词工程通过精心设计的指令激发模型潜力,适合封闭任务;而上下文工程则构建动态运行环境,支持多轮交互、状态管理和工具调用,更适合复杂任务和AI Agent应用。随着大模型技术发展,上下文工程正成为AI应用时代的关键基础设施,决定模型能否发挥其应有能力。
大型语言模型(LLM)已成为人工智能领域的核心技术,掌握其理论体系与实践方法对于开发者、研究人员和技术决策者至关重要。本文将基于最新行业实践和学术研究成果,构建一套从零基础到精通的完整学习路径,涵盖数学基础、编程技能、模型架构、训练优化、应用开发等关键环节,帮助您系统性地掌握LLM核心技术栈。
摘要: 自然语言处理(NLP)是人工智能的重要分支,旨在让机器理解并处理人类语言,涵盖机器翻译、情感分析、问答系统等任务。传统方法依赖RNN和CNN,但2018年BERT模型的推出革新了NLP领域,通过预训练和微调实现高效迁移学习。Transformer架构的引入进一步提升了模型性能。当前,AI大模型发展迅猛,国内超10亿参数模型已超百个,行业人才缺口巨大。学习AI大模型需系统规划,但丰富的资源为
它通过从本地数据源检索培训后信息的方式来增强大语言模型的能力。SECO公司的目标是在构建面向未来的边缘解决方案时确保系统集成商和原始设备制造商具有灵活性,同时保持对于功耗、外形尺寸和部署成本的控制。正因如此,SECO开发出一款由高通跃龙 QCS6490驱动、基于SoC运行的边缘AI助手,该解决方案采用结合检索增强生成技术的大语言模型,其结构紧凑到足以在单个系统模块 (SoM) 上运行。作为AI和物
它与 RK3588 AI Module7 配合使用,为您提供一个微型 AI 开发平台,支持定制载板开发,并加速机器学习在智能设备原型设计中的部署。AIM-IO 通过提供开放的灵活性和快速迭代支持,赋能开发者、教育工作者和创客。1× MIPI-DSI DPHY 2× 通道;2× MIPI-CSI RX 4× 通道;1× MIPI-DSI DPHY 2× 通道;在那里,您可以与我们的团队和其他用户沟通
通过上文可以看到,大语言模型在自然语言理解和生成方面取得了重要的突破,并在多个领域展示了创新应用的潜力,而且亚马逊云科技在大语言模型领域的创新应用加速了人工智能技术的发展和应用。同时,大语言模型的创新应用涵盖了智能客服、信息搜索、自然语言处理和文本分析、创意生成和内容创作和翻译等多个领域,对行业和社会产生了积极的影响,这些创新应用提升了企业的智能化水平,改变了人们与技术的互动方式,提高了生活便利和
大型语言模型,如OpenAI的GPT-4或谷歌的PaLM,已经在人工智能领域掀起了一场风暴。然而,大多数公司目前没有能力训练这些模型,而且完全依赖少数几家大型科技公司作为技术提供者。在Replit,我们已经大量投资于所需的基础设施,以从头开始训练我们自己的大型语言模型。在这篇博文中,我们将概述我们如何训练LLM,从原始数据到面向用户的生产环境中的部署。
目录一、词的离散表示1、One-hot编码(独热编码)2、Bag of Words(BOW,词袋模型)3、N-gram语言模型二、词的分布式表示(Distributed Representation)1、共现矩阵(Co-currence Matrix)2、神经网络语言模型(Neural Network Language Model,NNLM)3、Word2Vec,G...
语言模型的ppl计算公式:
GPT-4是OpenAI公司3月推出的新一代人工智能预训练AI模型,是一个多模态大型语言模型,使用了1.5万亿个参数,是GPT-3.5的10倍之多,当然它也是世界上最大的人工智能模型。
语言模型已经彻底改变了自然语言处理(NLP)(NLP)。总所周知,增加语言模型的规模能够为一系列下游的NLP\text{NLP}NLP任务带来更好的效果和样本效率。在某些场景中,模型规模对于模型的效果可以通过预测。但是,某些下游任务的效果并没有随着规模的上升而改善。本文讨论了大规模语言模型的涌现能力,一种不可预测的现象。涌现这一概念已经在物理、生物、计算机科学等领域被讨论了很长时间。本文考虑涌
预训练语言模型介绍。
收集人类反馈奖励模型训练强化学习训练RLHF(Reinforcement Learning from Human Feedback,基于人类反馈的强化学习),一种机器学习方法,它使智能系统能够从环境中学习并最大化特定目标。在RLHF中,通过对同一输入的多个生成结果进行人工排序,获得包含人类偏好反馈的标注数据,从而训练出一个奖励模型(Reward Model)。在强化学习的过程中,奖励模型将对大语言
MetaAI最近发布的,论文链接:https://arxiv.org/abs/2308.06259。
钉钉个人版正式开始内测,面向小团队、个人用户、高校大学生等人群。该版本具有AI为核心的功能,包括文生文AI、文生图AI和角色化对话等。用户可通过自然语言对话和绘画等方式使用AI服务。个人版还提供文档协作和存储、会议等功能。未来,个人版还将引入更多的第三方AI服务和功能。钉钉个人版是钉钉首次提出的个人版产品,旨在为用户提供更轻盈的效率套件。
机器学习&&深度学习——BERT(来自transformer的双向编码器表示)
在“使用大型语言模型(LLMs)的生成性AI”中,您将学习生成性AI的基本工作原理,以及如何在实际应用中部署它。对于那些对LLMs的工作原理有良好基础理解的开发者,以及了解训练和部署它们背后的最佳实践的人,他们将能够为公司做出明智的决策,并更快地构建工作原型。这门课程将帮助学习者建立关于如何最好地利用这一令人兴奋的新技术的实用直觉。这是一门中级课程,所以您应该有一些Python编码的经验,以便从中
微软必应的首席执行官米哈伊尔・帕拉欣表示,必应聊天表现优于OpenAI的GPT-4,但使用了更高成本的检索增强推理技术。必应聊天基于GPT-4模型,结合了检索增强推理技术,能生成更准确、相关、流畅和连贯的文本。然而,检索增强推理技术需要更多计算资源和时间,并可能带来不准确、不相关的信息,同时也会引发版权和隐私问题。微软表示正在积极监测用户反馈并计划改进必应聊天系统。
Pre-trained Language Model(PLM)模型BERT 具有两种输出,一个是pooler output,对应的[CLS]的输出,以及sequence output,对应的是序列中的所有字的最后一层hidden输出。所以BERT主要可以处理两种,一种任务是分类/回归任务(使用的是pooler output),一种是序列任务(sequence output)
机器学习&&深度学习——RNN的从零开始实现与简洁实现
据悉,C-Eval Hard(难题)类别是首个提供中文复杂推理能力的测试,“即便是GPT-4来做这个题也会很吃力,”张旭提及,“这是‘闭卷考试’,而以往如AGIEval和MMLU是‘开卷考试’,也就是说,AGIEval和MMLU是各公司自己测试、自己打分、自己公布成绩,而C-Eval Hard的评比显然更加客观、可信。为了弥补中文大模型在评测领域的缺失,日前由清华大学、上海交通大学和爱丁堡大学合作