登录社区云,与社区用户共同成长
邀请您加入社区
计算机-人工智能-图像分类长尾问题ResNet骨干上对于不同采样和权重的测试
PyTorch:需要手动编写训练循环,灵活性高,适合自定义训练逻辑(如动态调整学习率、添加特殊训练步骤);语法更接近Python,调试时可实时查看张量值;TensorFlow/Keras:通过compile和fit封装了训练流程,代码更简洁规范,但自定义逻辑需要额外编写回调函数;适合快速验证想法,但灵活性稍差。优先选PyTorch:如果你是零基础、想快速上手AI、目标是算法岗或学术研究,PyTor
直接拿走,意外获得200多套代码,需要的滴我企业级深度学习opencv手势识别管理系统智能识别系统源码|Python+YOLO+CNN架构+完整数据集【完整版】(可提供说明文档(通过*AIGC*)
中国科技公司在开源AI模型领域正超越美国,阿里巴巴Qwen、DeepSeek等模型在LMArena评级和Hugging Face点赞数上领先。美国公司如OpenAI和Google倾向将技术保密,而中国公司更愿分享最佳模型。这引发了对技术价值观和地缘政治影响的讨论,促使美国启动ATOM项目以提升开源AI竞争力。
本文档旨在作为理解大语言模型(LLM)后训练基础的指南,涵盖了从预训练模型到指令微调模型的完整流程。从“下一个token预测”到“指令遵循”的转变过程有监督微调(Supervised Fine-Tuning, SFT)基础,包括数据集构建与损失函数各类强化学习技术(RLHF、RLAIF、RLVR)及奖励模型的详细解析用于评估模型质量的评估方法。
RTX4090的算力跃迁为深度学习训练带来质变级加速。通过系统级优化组合,开发者可稳定实现$50%$以上的效率提升。随着CUDA生态持续演进,未来将释放更大硬件潜力,推动AI模型迭代进入小时级时代。注:本文实验基于PyTorch 2.0/TensorFlow 2.12框架,测试模型包含ViT、Swin Transformer等典型视觉架构,实际加速效果因模型结构及超参配置存在浮动。
Python,由Guido van Rossum于1989年发明,以其简洁、优雅和易读的语法而闻名,被誉为“可执行的伪代码”。然后,提供一个简单的代码示例,展示如何创建一个计时装饰器来测量函数执行时间,并附上详细的注释。本教程将带你从零开始,逐步掌握Python的核心概念,并学会如何利用AI工具(如ChatGPT)来提升你的编程效率。代码的功能是检查一个数字是否为偶数,如果是,则打印’Even’,
【摘要】本研究提出置信深度思考(DeepConf)方法,通过动态过滤低质量推理轨迹显著提升大语言模型的推理效率与性能。该方法创新性地利用局部置信度信号(如最低组置信度、尾部置信度),在生成过程或生成后实时识别低置信度轨迹。实验表明,在AIME2025等数学推理基准测试中,DeepConf@512达到99.9%准确率,相比传统自洽性方法减少84.7%的token消耗。该方法无需额外训练即可适配不同规
字节提出人工海马网络,让AI像人脑一样高效处理超长信息
Zig-RiR(Zigzag RWKV-in-RWKV)是一种专为高效医学图像分割设计的新型神经网络架构,由 Chen 等人在 2025 年提出。它基于 RWKV(Receptance Weighted Key Value) 模型——一种具有线性计算复杂度、能高效建模长序列的类 Transformer 架构——并针对医学图像的特性进行了关键性改进。注:关于RWKV的讲解请看博主的这篇文章:htt
文章介绍了KIMI最新推出的AI智能体OK Computer的功能与应用。作者通过实战案例展示了OK Computer在制作旅行规划网页、留学规划PPT和儿童绘本三个场景中的出色表现。该智能体能根据简单提示词生成完整网页、专业PPT和互动式绘本,包含自动计算器、语音朗读、知识问答等功能。免费用户每天可使用三次,适合需要快速生成各类内容的人群,是AI时代提升效率的实用工具。
本文探讨了如何利用LLM(大语言模型)构建Agent来解决GAIABenchmark中的问题。通过LangGraph框架,作者设计了一个包含搜索、网页访问等工具的Agent,能够处理60%的Level1级别问题。文章详细介绍了构建过程,包括节点设计、状态流转和边连接等关键技术点,并分析了实际案例中的推理过程。此外,作者还分享了Agent构建中的关键经验,如Token数量控制、多模型选择策略以及搜索
命名实体识别(NER)是自然语言处理(NLP)中的基础任务,旨在从文本中识别具有特定语义含义的实体,如人名、地点、组织机构和机构名称。它在知识图谱、信息提取和文本理解等方面发挥着重要作用。在实际应用中,不同领域文本流派和术语的巨大差异构成了重大挑战,经常导致特定目标领域内标注数据的稀缺性。因此,针对跨领域场景,特别是跨领域命名实体识别(CD-NER)的模型适应性在近年来引起了极大的研究关注。这在资
如今,软件测试到底怎么样?现在还值得入行吗?
三星研发的Tiny Recursive Model (TRM)是一个仅700万参数的小型AI模型,却能在推理任务上超越DeepSeek-R1、Gemini 2.5 Pro等大模型。其成功关键在于独特的"递归推理"机制,让模型像人类一样先思考再行动:先生成答案草稿,然后在"思考区"进行多轮自省和修改,优化答案。这种架构创新而非规模堆砌的方式,证明了AI推理能力更多依赖内部设计而非参数量。TRM为开发
AI的必经之路
AI 的必经之路
本文详细介绍了字节跳动推出的低代码智能体开发平台Coze的核心特点和功能。Coze以免费易用、多模型支持和跨平台发布为核心优势,显著降低了AI应用开发门槛。文章系统解析了六大核心功能:扩展能力的插件系统、增强认知的知识库、结构化数据管理的数据库、可视化图像处理的图像流、实现逻辑编排的工作流,以及处理复杂任务的多智能体协作机制,为各类开发者提供了强大的低代码AI应用开发解决方案。
人工智能的必然之路
2025年第五届人工智能与大数据国际学术研讨会 (AIBDF 2025)将于2025年12月26-28日在贵州省贵阳召开。会议主要围绕人工智能、大数据等研究领域展开,旨在为从事计算机等相关研究的专家学者提供一个交流科研成果和前沿技术的平台,了解学术发展趋势,拓宽研究思路,加强学术研究和讨论,促进学术成果产业化合作。
摘要:NeuTTS Air开源语音合成模型爆火,仅0.5B参数即可实现媲美商业API的写实语音效果,支持3秒极速声音克隆和本地部署。该模型采用NeuCodec音频编解码器,能模拟人类语气变化,支持全设备运行并内置水印技术。可广泛应用于内容创作、无障碍服务等场景,开发者现可免费使用。项目明确禁止非法用途,多语言适配正在进行中。
大模型浪潮席卷全球,在各行各业中的重要性愈发凸显,呈现出一股不可逆转的发展趋势。这一年本人所在业产技也在这一过程中持续探索和尝试AIGC。本文一方面是对AIGC实践的总结回顾,同时也是本人学习实践AIGC过程中一些笔记、心得分享。因个人能力限制,文章中可能存在一些理解或表述错误的地方,希望各位大佬能及时批评和指正。
作者作为芯片验证工程师,亲测了6款AI大模型在专业领域的表现。豆包在国内模型中表现最佳;Gemini和Grok开源后效果出色,适合有经验工程师交叉使用;GPT-5和Copilot在芯片验证领域表现一般,但Copilot在专业文档处理上有明显提升。文章强调训练数据质量对AI模型性能的重要性,并暗示国内AI模型整体偏弱可能与此有关。
近三年来,AI行业的“人才角逐战”早已突破单纯“招揽人才”的初级阶段,对于头部科技企业而言,这场人才争夺已升级为决定未来市场地位与技术突破的关键战略布局。随着生成式AI技术的快速迭代与各行业数智化转型的深入推进,企业对AI人才的需求不再局限于基础技术能力,更偏向具备跨领域实践经验与创新思维的复合型人才。
摘要: NVIDIA Run:ai v2.23与Dynamo深度集成,通过智能多节点调度优化大规模语言模型(LLM)推理效率。Dynamo专为分布式推理设计,支持分离式预填充与解码、动态GPU调度及KV缓存卸载,但多组件协调仍是挑战。Run:ai的Gang调度确保原子化部署,拓扑感知调度优化组件放置,减少跨节点延迟。实战指南详细演示了如何在Run:ai环境部署Dynamo,结合Kubernetes
文章详解了人工智能(AI)、机器学习(ML)、深度学习(DL)和ChatGPT的层级关系:AI是广泛领域,目标是创造智能体;ML是实现AI的主要方法,从数据中学习规律;DL是ML的子集,使用深度神经网络处理非结构化数据;ChatGPT是DL的具体应用,基于Transformer架构的大型语言模型。通过自动驾驶类比帮助理解这种从目标到方法再到应用的层级关系,为学习大模型提供清晰路径。
说起阿里巴巴,很多人第一反应就是「电商」:我在淘宝上买东西、商家在天猫开店。但现在,阿里要让你更多把它当作云厂商、AI 基础设施提供者来看。本文想搞清楚三个问题:阿里在云 + AI 里到底干什么?它赚不赚钱?这条路有没有希望?
操作简洁、界面清爽,是一款轻量化文献管理器。只需输入一句话,WisPaper就能在短时间内检索成千上万篇文献,并自动筛选出最相关的必读论文,帮助科研新人和资深学者快速锁定研究重点,节省大量阅读时间。一款基于AI的文献摘要工具,能自动生成论文精简版,提取核心结论、图表和参考文献。Zotero是一款文献管理软件(Windows&iOS),可以了利用GPT和Zotero结合,达到本地阅读文献并实现对全文
大模型正颠覆传统搜索范式,通过深度语义理解、对话式交互和实时推理能力解决信息过载和关键词匹配局限等问题。尽管存在实时性不足和"AI幻觉"等缺陷,大模型与搜索引擎将走向融合而非替代。未来将出现"答案引擎"与传统搜索引擎共存的混合信息门户,开发者应掌握这一变革趋势,提升信息获取效率。
本文深入解析AI智能体(AI Agent)的核心概念与技术架构,详细阐述其五大核心能力(规划、记忆、工具调用、行动、反思)与传统AI的本质区别。文章介绍了AI Agent在个人助理、企业应用和行业场景的落地实践,分析了当前面临的挑战与未来发展趋势,帮助读者全面理解下一代AI范式。
一文读懂AI大模型训练全流程,从准备到落地清晰拆解!
本篇章将会教学如何基于mysql已有的对话历史实现上下文对话。关于这里有一个存在的点,这个历史对话大模型是能拿的到的,但是会出现有些大模型提示无法回答你的问题的情况拒绝回答,原因是模型内置规则不允许做了硬性拦截,主要是保护用户隐私,即使做了提示pormt增强提示,还是不允许的。可以以去换一个模型,目前我已知的情况的出现这种模型的为每家平台的全模态或者多模态模型,普通模型是允许拿到的。AI智能体(A
AI 相关的人才缺口已达 500 万,其中AI产品经理需求旺盛,薪资中位数再创新高,36k/月。如果是在头部公司,加上年终奖、项目奖金和期权等,一年50W不是梦想!随着Ai在不同业务场景中价值体现,AI产品经理岗位要求也越发细分,B端方向成为主阵地。不少人十分心动,没有吃上移动互联网的红利,这波AI红利一定不能再错过啦。
OpenAI最新研究揭示大模型幻觉根本原因:训练和评估过程奖励猜测而非承认不确定性。文章从统计必然性、数据稀缺性和模型能力三方面分析幻觉成因,指出主流评测方法都惩罚不确定性,进一步强化这一问题。解决方案是通过改变评分规则,让模型在不确定时可以选择"不知道",使"交白卷"成为可选项,从而减少错误信息的生成。
训练之奇淫巧技sweep训练自动化搜索超参
相关文章:哼,就是整活儿😎😎😎。之前写了《手搓神经网络——BP反向传播》一文。此本便是基于前文的“实战”,基于之前手搓的神经网络框架,实现 Fashion MNIST 训练。毕竟实践出真知,在前篇中的验证仅验证了神经网络框架的自动求导正确与否…加载数据集使用 TensorFlow 加载 Fashion MNIST对训练数据集打乱,设置批大小定义激活函数、损失函数这个在《手搓神经网络——BP反
接上文,再举个例子,小孔成像,如果把小孔扩大成某个形状,那么它就是卷积核,所成的像旋转180度,就是卷积结果。由此引申,眼科疾病散光、动物的不同瞳孔形状,都可以看作卷积核。
常见的模型压缩方法有以下几种:模型蒸馏 Distillation,使用大模型的学到的知识训练小模型,从而让小模型具有大模型的泛化能力量化 Quantization,降低大模型的精度,减小模型剪枝 Pruning,去掉模型中作用比较小的连接参数共享,共享网络中部分参数,降低模型参数数量1. teacher-student模型teacher-student模型是迁移学习的一种,迁移学习也就是将一个模型
预训练模型是什么?为什么预训练模型大行其道?
本文是模型融合的经验方法总结。包含了投票法、平均法、排序法、Stacking 和 Blending.一、背景之前有段时间打数据挖掘类比赛,看到很多选手用模型融合的技巧,特别是比赛后期的时候...
LoRA(Low-Rank Adaptation of Large Language Models,大型语言模型的低秩适应)是微软研究员提出的一种新颖技术,旨在解决微调大型语言模型的问题。研究人员发现,通过专注于大型语言模型的Transformer注意力块,LoRA的微调质量与完整模型的微调相当,同时速度更快,计算需求更低。训练权重更小,因为原始模型被冻结,我们注入新的可训练层,可以将新层的权重保
讯飞星火认知大模型使用
一、Bert 模型BERT 模型的全称是 BidirectionalEncoder Representations from Transformer,基于 Transformer 的双向编码器表示,是一个预训练的语言表征模型,它强调了不再像以往一样采用传统的单向语言模型或者把两个单向语言模型进行浅层拼接的方法进行预训练,而是采用新的 masked language model(MLM),以致能生成
《探索文心千帆大模型平台: 代码编写从此变得轻松》
目录1、模型量化是什么?2、为什么需要做模型量化?3、模型量化动机是什么?4、模型量化分类4.1 线性量化4.1.1 对称量化4.1.2 非对称量化4.2 逐层量化、逐组量化和逐通道量化4.3 在线量化和离线量化4.4 比特量化4.5 权重量化和权重激活量化5、模型量化原理详解5.1 原理详解5.2 具体案例6、模型量化实现步骤7、Pytorch模型量化详解7.1 简介7.2 pytorch量化工
源|新智元Meta的LLaMA模型开源,让文本大模型迎来了Stable Diffustion时刻。今天,斯坦福发布了一个由LLaMA 7B微调的模型Alpaca,训练3小时,性能比肩GPT-3.5。一觉醒来,斯坦福大模型Alpaca(草泥马)火了。没错,Alpaca是由Meta的LLaMA 7B微调而来的全新模型,仅用了52k数据,性能约等于GPT-3.5。关键是训练成本奇低,不到600美元。具体