登录社区云,与社区用户共同成长
邀请您加入社区
这篇文章详细介绍了SFT和RLHF的技术原理和实现细节
Codex、Claude Code、Cursor、Hermes Agent、OpenClaw等工程化实战专栏 ,讲透 AI 如何接管脏活累活
Codex 与 Codex++ 安装配置教程:接入 OpenCode Zen 的完整流程
【大模型时代的三大奠基性突破】本文解析了奠定当前AI大模型发展的三大里程碑式研究:1. Transformer(2017)通过自注意力机制实现模型并行化训练,为规模化扩展奠定工程基础;2. BERT(2018)确立预训练-微调范式,使模型能力可迁移复用;3. GPT-3(2020)突破few-shot学习阈值,开创无需微调的prompt应用范式。这三项突破分别解决了模型可扩展性、能力可迁移性和使用
我们在scite的目标是引入下一代引用——称为智能引用——它显示任何文章、研究人员、期刊或主题如何以及为什么被引用,以及更广泛地在文献中被讨论。通过与出版商合作,我们直接从全文文章中提取他们在正文中使用参考文献的句子。这些句子提供了关于新工作如何引用论文的定性见解。这有点像研究领域的“烂番茄”。这需要访问全文文章,并与出版商合作,以便我们能够使用机器学习大规模提取和分析引用语句。
摘要:大模型训练与部署的核心技术包括分布式并行策略、算力效率评估和性能优化。Megatron SPTD组合了张量、序列、流水线和数据并行,有效突破单GPU限制。MFU指标通过计算实际与理论FLOPs比值评估算力利用率,优化需减少通信开销。GPT3-175B采用激活重计算、混合精度训练和权重量化等技术,结合SPTD并行策略,实现高效训练与推理。(150字)
MuyuGPT是一个覆盖ChatGPT、Claude、Gemini和Grok的中文AI会员订阅协助与使用指南项目。本文记录我们如何建立产品分类、套餐字段、订单说明、安全文档和内容更新机制,并复盘为什么一套AI订阅知识库必须同时解决信息统一、用户决策和长期维护三个问题。
本文深入探讨了大模型技术在智慧农业精准种植中的应用,分析了传统农业在决策盲目、资源浪费及病虫害防控滞后等方面的痛点。通过引入农业大模型,农业生产实现了从经验驱动向数据驱动的跨越,涵盖了智能水肥决策、作物生长模拟及病虫害预警等核心场景。大模型不仅提升了农业生产效率和资源利用率,更通过多模态数据融合为农民提供了保姆式的技术支持,开启了农业数字化的新纪元。
在开发智能应用时,很多开发者常常面临一个两难选择:是花费大量时间训练自己的模型,还是直接调用成熟的云端 API?对于大多数需要快速验证想法或构建原型的团队来说,后者往往是更高效的路径。尤其是当我们需要处理复杂的文本生成、代码辅助甚至是图片理解任务时,选择一个响应迅速、功能全面且易于集成的模型至关重要。Google 推出的新一代模型系列正好填补了这一需求空白。它们不仅在逻辑推理和长文本处理上表现出色
本文介绍了如何通过 responses-proxy 将第三方 OpenAI 兼容服务 agnes-20-flash 接入原生 Codex。由于 Codex 默认使用 Responses API,而多数第三方服务仅支持 Chat Completions API,需要通过代理进行协议转换。文章详细说明了配置步骤,包括设置代理服务、修改 Codex 配置文件等,并推荐了更稳定的中转服务满意AI。方案保持
本文是对LLaMA大模型研究系列的总结,重点解读了LLaMA论文的核心贡献。LLaMA证明了仅使用公开数据,通过合理的数据规模、模型结构和训练优化,就能训练出性能强大的基础语言模型。论文提出了7B-65B参数的模型系列,其中LLaMA-13B在多数任务上超越了GPT-3 175B,而LLaMA-65B则与Chinchilla-70B和PaLM-540B竞争。LLaMA的创新点在于强调"小而强"的路
摘要 论文《PatentGPT: A Large Language Model for Intellectual Property》提出了一套面向知识产权领域的领域大模型训练流程,而非全新架构。针对知识产权领域三大核心挑战——专业知识强、隐私要求高、文本极长,研究团队以LLaMA2/Mixtral等开源模型为基础,通过240B+token的IP领域数据继续预训练、指令微调(SFT)、强化学习对齐(
CCSwitch是一个本地代理工具,可将第三方大模型API转换为OpenAI兼容格式,使CodexCLI/CodexDesktop支持小米MiMo、Claude等模型。安装后通过15721端口转发请求,用户只需在界面添加供应商API信息并激活即可使用。它能自动管理Codex配置,支持热切换供应商和多种代理模式,并备份配置日志方便排查问题。操作流程为:安装软件→添加供应商→激活使用→通过Codex直
别急着给全员发账号。在按下“Run Task”之前,请对照这份清单,确保你的仓库已经做好了迎接“硅基实习生”的准备。
证明了"大规模无标注文本预训练 → 具体任务微调"这条路走得通。在 GPT-1 之前,NLP 主流是每个任务训练专用模型。GPT-1 提出了一个范式的范式:预训练捕获通用语言知识 → 微调迁移到新任务只需几千条标注。# GPT-1 核心思想# 预训练:BooksCorpus 7000+ 本书,预测下一个 token# 微调:加任务头,少量标注数据即可迁移。
本文介绍了GPT模型的架构原理与代码实现,旨在帮助初学者理解大语言模型的核心机制。主要内容包括:1. GPT模型整体流程,通过12层解码器处理文本嵌入,输出预测分数和分类信息;2. 关键组件详解:旋转位置编码(RoPE)解决长文本位置信息问题,带掩码的多头自注意力机制计算过程;3. 代码分模块解析,包括词嵌入、解码器层和前向传播网络;4. 完整实现了一个简易GPT模型,包含文本生成功能。文章采用P
2026年企业级RAG知识库选型实战对比显示,Dify和FastGPT适合偏好开源生态与可视化工作流的团队,而SmartRAG在低算力开销、高准确率和企业级权限隔离方面表现更优。实测数据表明,SmartRAG在响应延迟(<210ms)、复杂表格解析召回率(94.5%)和混合检索召回率(92.8%)上均领先,且硬件需求更低(8G显存)。其技术架构采用多粒度切片和混合检索策略,结合动态重排序,显著提升
openclaw源码解读(4)——server.impl.ts 真正的启动引擎 第二阶段:插件 & 运行时配置
对于习惯使用 Cursor、Windsurf、Claude Code、Codex 等 AI IDE 的开发者,Model123 提供了低延迟、高可靠的专属路由。如果你也在探索更高效的 AI 工程化实践,不妨试试这个新工具,或许它就是你的下一块拼图。:想对比 Claude、GPT、Gemini 的效果,却要分别注册账号、绑定信用卡、阅读不同的 API 文档?:个人项目或团队测试阶段,缺乏精细的用量统
马斯克宣布Grok将推出4.6和4.7双版本:4.6版8月7日发布,1.5T参数,重点优化监督微调(SFT)和强化学习(RL)训练质量;4.7版参数增至2.1T,虽推理稍慢但token效率更高。两版本定位不同,4.6强调"更聪明"而非更大,4.7则追求模型上限。建议用户先体验4.6的实际表现,待4.7发布后再根据评测决定是否切换。马斯克此举将Grok产品线分为两个技术方向,反映了AI行业从参数竞赛
之前手搓过GPT-2(),然后一时兴起想梳理一下GPT1~3的技术路线。维度GPT-1GPT-2GPT-3论文时间201820192020最大参数量117M1.5B175B架构训练目标自回归 next-token prediction自回归 next-token prediction自回归 next-token prediction主要数据WebText上下文长度512 tokens下游适配核心贡
DeepSeek 作为新一代大语言模型,凭借其强大的推理能力与极具竞争力的价格,正在成为越来越多开发者的首选。在动手写代码之前,先理解它的核心特性,能帮你少走很多弯路。DeepSeek API 兼容 OpenAI 接口格式,直接使用 OpenAI SDK 即可,只需修改 base_url。DeepSeek 提供了官方 Python SDK,同时也兼容 OpenAI SDK,你可以根据自己的习惯选择
DeepSeek V4 Flash 正在重新定义大模型 API 的成本与使用边界。文章围绕 “单日消耗 8 万亿 Token” 这一现象展开,分析了其背后的 MoE 架构优势、极致性价比、Agent 任务爆发式增长,以及全球开发者从高价模型向低成本国产模型迁移的趋势。数据显示,在 OpenRouter 调用量前五名中,国产模型已占据全部席位,DeepSeek V4 Flash 更以显著价格优势改变
本文从嵌入式开发者视角实测 DeepSeek v4 flash,横向对比 ChatGPT 与 Claude 在代码生成、驱动解析、内存泄漏排查和技术文档翻译中的表现。测试发现,DeepSeek v4 flash 在基础嵌入式 C 代码、串口驱动分析、Bug 排查等场景表现稳定,核心优势在于极低的 API 调用成本,能显著降低个人开发者和小团队使用大模型的门槛。不过,它目前仍不支持多模态,复杂系统架
OneLLM是一款面向国产大模型生态的统一控制平面系统,通过集中化管理解决企业使用多模型时面临的三大痛点: 密钥碎片化:用一个虚拟Key统一接入多个厂商API,避免密钥散落各处的问题 成本黑洞:自动记录每次调用的模型、token量、费用等数据,实现精准成本统计 Agent失控:提供预算告警和硬熔断机制,防止AI应用过度消耗资源 系统作为中间网关,兼容OpenAI API格式,开发者只需修改一行代码
本文介绍了LLaVA(Large Language and Vision Assistant)模型,提出了一种视觉指令微调方法(Visual Instruction Tuning)。LLaVA通过连接CLIP视觉编码器和Vicuna语言模型,构建了一个能理解图像并遵循自然语言指令的多模态助手。论文创新性地利用GPT-4生成了158K高质量的视觉指令数据,包含对话、详细描述和复杂推理三类任务。模型采
本文针对大模型应用中Token成本高的问题,提出三大降本策略:1)动态意图识别实现按需路由,简单任务分配轻量模型;2)精细化Token配额管理,设置子Key和额度上限;3)高可用多活机制避免报错重试浪费。同时指出自研代理的维护成本风险,推荐采用智能路由网关实现无感降本40%。
《思维链提示激发大语言模型推理能力》论文摘要(150字): 本文提出思维链提示(Chain-of-Thought Prompting)方法,通过few-shot示例展示"问题-推理过程-答案"的完整链条,引导大语言模型在回答复杂推理问题时生成中间推理步骤。实验表明:1)CoT效果随模型规模增大而涌现;2)多步推理任务收益更显著;3)推理链必须置于答案前才有效;4)实质是扩展了自回归生成的序列计算深
摘要: 本文提出不确定性引导的视觉回看方法(Uncertainty-Guided Lookback),解决多模态推理中模型因视觉漂移导致的错误累积问题。研究发现,传统长思维链(CoT)可能因初始误读图片而持续偏离正确答案,而重新访问视觉证据比单纯延长语言推理更有效。该方法通过检测模型生成的不确定性短语(如“wait”),自动触发图片回看机制,在Qwen3-VL模型上使MMMU-val准确率提升2.
摘要:本文探讨如何构建不依赖单一AI Agent的可迁移科研工作流,解决工具切换时的重复配置问题。提出以项目规则、共享AgentHub和本地私有区为核心的组织架构,强调将Skills、MCP配置等元素独立存储,而非绑定特定Agent。虽然官方导入工具能实现临时迁移,但长期解决方案需从项目设计阶段避免平台锁定。文末提供可迁移工作流工具包下载。(135字)
该项目是一个网页爬虫的python包,使用LLM和直接图逻辑(direct graph logic)来为网页和本地文档(XML, HTML, JSON)创建爬取管道(pipeline)。一句话足矣~本文主要是通过Scrapegraph-ai集成gpt3.5实现一个简单的网页爬取并解析的demo应用,其中涉及到gpt3.5免费申请,Scrapegraph-ai底层原理简介,demo应用源码等。之后会
如果你想请求 GPT-3.0,可以使用 OpenAI 的 API,它提供了通过 Python 请求 GPT-3.0 的方法。首先,你需要注册 OpenAI API 并获取 API 密钥,然后在 Python 代码中使用 requests 库请求 API,将请求参数以 JSON 格式发送给 API 并获取相应的输出。具体代码可以参考 OpenAI 的官方文档: https://beta.opena.
chatgpt 最近很火。使用 chatgpt 问一些问题还是很有用的。比如面试题,面试题的答案。简直不要太爽。不过闲来无事,也使用 openai 提供的api ,写了几个小页面,可以进行聊天,和绘画
您好!作为一名电脑小白,您可以使用以下步骤来训练GPT-3写作模型:获取GPT-3 API访问权限:您需要在OpenAI上注册一个账号,并申请API访问权限。准备数据集:您需要准备一个包含大量文本的数据集,这些文本将作为模型训练的材料。设置训练参数:您需要确定模型的训练参数,例如训练次数、批量大小等。运行训练:使用OpenAI的API访问权限,向API发送训练请求,并按照您设定的参...
在使用AI编写脚本时非常有用。
确保你的Linux服务器或电脑满足DeepSeek的硬件要求,包括至少4核的CPU(如Intel i5或更高)、推荐NVIDIA GPU(如RTX 3060或更高,支持CUDA加速)、16GB以上的内存以及至少20GB的可用存储空间1。如果你需要在远程访问Linux服务器上的DeepSeek模型,可以借助内网穿透工具(如贝锐花生壳)或异地组网工具(如贝锐蒲公英)来实现3。表示320亿参数的模
结合上面的示例你应该对chatgpt Function calling(函数调用)的用法和用途有所了解了,如果还是不明白可以私信,或者联系我。
gpt-3
——gpt-3
联系我们(工作时间:8:30-22:00)
400-660-0108 kefu@csdn.net