logo
publist
写文章

简介

该用户还未填写简介

擅长的技术栈

可提供的服务

暂无可提供的服务

大模型架构研究:从Transformer到混合智能体的演进之路

2026年大模型架构创新呈现三大趋势:MoE成为主流,400B+参数模型普遍采用精细化MoE架构,解决Token Dropping问题;状态空间模型Mamba-2通过结构化状态空间双重性实现线性复杂度,支持长序列处理;混合架构兴起,结合Transformer和SSM优势,如NVIDIA Nemotron 3 Super等模型在效率与精度间取得平衡。未来架构将向MoE精细化、混合设计及硬件协同方向发

文章图片
#架构#transformer#深度学习 +2
8 月 AI 领域动态全景报告:全球治理加速、巨头战略分化与投资逻辑之变

8月AI领域动态密集,全球治理框架加速落地,澳大利亚、日本等国出台AI监管政策,英国提议设立AI安全机构。国内AI成为经济新动能,相关产业出口增长47.3%。巨头动作频繁:英伟达与LG深化机器人及AI工厂合作;OpenAI更换CRO加速商业化;DeepSeek V4 Pro大幅上调API价格;Anthropic拟以2万亿美元估值IPO并收购Decart解决算力瓶颈。资本市场方面,AI硬件投资火热,

#人工智能#大数据
8 月 AI 领域动态全景报告:全球治理加速、巨头战略分化与投资逻辑之变

8月AI领域动态密集,全球治理框架加速落地,澳大利亚、日本等国出台AI监管政策,英国提议设立AI安全机构。国内AI成为经济新动能,相关产业出口增长47.3%。巨头动作频繁:英伟达与LG深化机器人及AI工厂合作;OpenAI更换CRO加速商业化;DeepSeek V4 Pro大幅上调API价格;Anthropic拟以2万亿美元估值IPO并收购Decart解决算力瓶颈。资本市场方面,AI硬件投资火热,

#人工智能#大数据
8 月 AI 领域动态全景报告:全球治理加速、巨头战略分化与投资逻辑之变

8月AI领域动态密集,全球治理框架加速落地,澳大利亚、日本等国出台AI监管政策,英国提议设立AI安全机构。国内AI成为经济新动能,相关产业出口增长47.3%。巨头动作频繁:英伟达与LG深化机器人及AI工厂合作;OpenAI更换CRO加速商业化;DeepSeek V4 Pro大幅上调API价格;Anthropic拟以2万亿美元估值IPO并收购Decart解决算力瓶颈。资本市场方面,AI硬件投资火热,

#人工智能#大数据
DeepSeek V4-Flash多模态智能体:技术突破、Agent能力跃升与性价比革命

摘要: DeepSeek V4-Flash(2026年发布)基于2840亿参数的MoE架构,仅激活130亿参数,在多模态推理与Agent能力上实现突破。其创新包括: 技术架构:混合注意力机制降低90%KV缓存,支持百万Token上下文; 多模态:提出“视觉原语”思维,将坐标嵌入推理链,解决“指代鸿沟”,在计数、迷宫等任务超越GPT-5.4等模型; Agent能力:通过后训练(非架构改动)显著提升任

文章图片
#人工智能#架构
从“写代码”到“编排智能体”:2026年软件工程的范式革命

2026年AI编程迎来范式革命:Meta推出MuseCode加入智能体"三国杀",阿里开源2.4万亿参数Qwen3.8-Max,国内外厂商在代码生成、修复等基准测试上激烈竞争。技术演进呈现三大趋势:1) 从单Agent转向多智能体协同,解决复杂工程任务;2) 大模型应用从编程向科研突破,通过实验验证闭环加速科学发现;3) 编程语言格局重塑,Rust首进TIOBE前十,Pytho

文章图片
#软件工程
到底了