logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

无痛安装 Codex:手把手教你走完下载到使用科研 Skill 的全过程

我们还注意到,近期不少同学反馈Codex安装中遇到各种报错,我们整理了近期的真实问题反馈,按 Windows 和 Mac 分类,并附上经过验证的解决步骤。为避免各位在下载过程中遇到的困难,我们还准备了 Mac 和 Win 的安装包。如果你也在安装过程中出现问题,欢迎后台私信我【B636】,这份问题解决指南和安装包会免费发送给您。

#人工智能#机器学习#深度学习 +1
ICCV 2025 | 联邦学习后门攻击重大突破!BadSFL控制变量劫持,非IID场景下潜伏超60轮!

本文提出了一种针对Scaffold联邦学习的新型后门攻击方法BadSFL,通过操纵控制变量机制将良性客户端转化为攻击"帮凶"。该方法结合GAN数据增强、多模态触发设计及控制变量优化策略,在非IID场景下实现了攻击效果的持久性和隐蔽性。实验表明,BadSFL在MNIST等数据集上后门成功率超过80%,攻击效果可持续60轮以上,是现有方法的3倍。研究首次揭示了Scaffold算法的

文章图片
#redis#数据库#缓存 +4
清华最新发布 | 大型推理模型的强化学习综述

本文系统阐述了强化学习(RL)驱动大语言模型(LLMs)实现复杂推理能力突破的关键技术与应用。核心创新在于可验证奖励机制(RLVR),通过过程奖励和生成式奖励提供精细反馈,结合GRPO等高效策略优化算法和结构化采样策略,显著提升模型在数学推理、代码生成等任务中的规划与自我修正能力。文章深入探讨了RL与监督学习的本质差异,分析了从不同基模型训练的影响,并全面介绍了支撑RL训练的数据资源、交互环境和基

文章图片
#人工智能#深度学习#机器学习 +2
0901-0905 | 大模型方向周报:可解释性与伦理、推理与记忆机制、信息检索与推荐、效率提升与资源优化等方向

本文精选20篇大模型领域最新研究,涵盖12个核心方向。研究发现:AI偏见显著影响人类决策(90%受试者被影响);概念级记忆机制提升推理能力7.5%;LLM在电商推荐中实现36%加购率提升;中文虚假信息核查存在局限;阿拉伯文化理解准确率仅72.15%。同时,研究揭示了LLM在自动驾驶迁移性、隐私政策解析、人格行为一致性等方面的突破与挑战,为技术发展提供了重要参考。

文章图片
#人工智能#机器学习#语言模型 +2
0908-0912 | 大模型周报:多模态融合、训练与优化策略、安全与对齐、行业应用等核心方向

本周精选12篇大模型领域前沿论文,覆盖模型压缩、多模态融合、训练优化和安全可靠性等方向。在模型压缩方面,ButterflyQuant提出可学习正交变换实现高效2位量化;ENSI创新结合加密方案与轻量架构,实现隐私安全推理加速;EvolKV通过进化搜索优化KV缓存管理。多模态领域,HumbleBench构建首个MLLM认知谦逊评估基准;MatCha发布材料科学专业理解测试;VIRAL提出视觉表征对齐

文章图片
#安全#人工智能#机器学习 +3
0915-0919大模型周报:覆盖LLM安全与对抗防御、LLM推理与优化、LLM多模态与跨领域应用等核心方向

【大模型前沿研究速览】本周精选12篇论文聚焦LLM四大方向:1)安全防御:提出DeepRefusal框架,通过概率消融重建拒绝机制,攻击成功率降低95%;2)推理优化:FlowRL框架通过奖励分布匹配增强推理多样性,数学推理性能显著提升;3)跨模态应用:多模态LLM实现零样本视频时空定位,街景分析还原历史政策影响;4)系统部署:LEAP架构结合存内计算,能效较GPU提升71倍。另含参数高效微调、课

文章图片
#安全#人工智能#机器学习 +2
OpenAI | 终极评测:GPT-5对决Claude 4.1,谁才是最强经济价值大模型?

OpenAI团队提出GDPval基准,旨在前瞻性评估AI模型在真实经济任务中的能力。该基准涵盖美国9大GDP贡献行业的44个职业,包含1320个由资深专家设计的真实任务。研究发现,前沿模型(如Claude Opus4.1)在近48%的任务中表现达到或超越人类专家水平,且性能随时间线性提升。研究还验证了增加推理努力、任务上下文和引导能有效提升模型表现。该工作为量化AI的经济价值提供了新框架,并开源了

文章图片
#人工智能#大数据#transformer +3
0922-0926 | 大模型周报:覆盖 LLM 强化学习优化、LLM 评估与偏见缓解、LLM 多指令与代码任务等方向!

【大模型前沿论文速览】本周精选12篇论文涵盖六大方向:1)强化学习优化:提出概率平滑策略(PSPO)和树搜索方法(Tree-GRPO),解决梯度不连续与奖励稀疏问题;2)评估与偏见:TrustJudge框架提升LLM评估一致性,MFA智能体缓解文化偏见;3)代码任务:创新多指令评估基准与语法纠错方法(PoCO);4)安全隐私:揭示水印技术漏洞(RLCracker)和智能体工具风险(AutoMalT

文章图片
#安全#人工智能#机器学习 +2
大模型前沿周报 (10.06-10.10):精选12篇,覆盖多智能体、自调试、鲁棒性评估等热点

本周精选12篇大模型前沿论文,聚焦5大研究方向:1)多智能体与语义网络建模,提出LLM辅助的AJAN框架建模方案;2)迭代优化与自调试,创新树引导策略优化和摘要式上下文管理;3)翻译与文本理解,开发质量感知解码和无监督短文本聚类方法;4)评估与鲁棒性,构建动态文本嵌入评估基准并揭示排序漏洞;5)工业应用,推出客服反馈飞轮、学术筛选工具和视频推荐系统。这些研究在提升大模型性能的同时,更注重降低使用门

文章图片
#人工智能#机器学习#语言模型 +1
大模型前沿周报 (10.13-10.17):从模型安全、基准测试到金融落地,四大方向12篇论文精华

本周精选 12篇大模型领域前沿论文,覆盖大模型安全与可信性、大模型评估与基准测试、大模型行业应用与落地、大模型技术架构与系统优化等方向。全部200多篇论文皆可扫码免费领取。➔➔➔➔点击查看原文,获取本期大模型周报合集llm词云图。

文章图片
#安全#金融#人工智能 +3
    共 116 条
  • 1
  • 2
  • 3
  • 12
  • 请选择