
简介
该用户还未填写简介
擅长的技术栈
可提供的服务
暂无可提供的服务
商汤开源多模态视觉模型SenseNova-Vision:统一范式突破CV任务边界 商汤科技旗下OpenSenseNova开源了SenseNova-Vision项目,通过多模态生成框架统一解决各类视觉任务。该模型创新地将检测、分割、OCR、深度估计等异构任务转化为文本/图像生成问题,仅需自然语言指令即可输出结构化结果(如坐标、掩码图等)。其覆盖范围远超传统多任务模型,在COCO检测、NYUv2深度估

阿里云发布千问Qwen3.6-Plus模型,实现编程智能体、通用智能体和工具调用三大能力跃升。该模型配备100万token超长上下文窗口,在编程基准测试中紧追ClaudeOpus4.5,部分表现超越;在通用智能体评测中与顶级模型同梯队,多模态能力全面提升。支持主流Agent框架,API调用价格低至2元/百万tokens。实测显示其"氛围编程"能力可快速生成完整应用,标志AI工作

Meta发布全新AI模型MuseSpark,标志着其AI战略的重大转型。作为Muse家族首款产品,该模型由新成立的MetaSuperintelligenceLabs开发,具备多模态推理、工具调用和多智能体协同能力。技术突破包括:训练效率提升10倍、强化学习驱动的稳定能力增长、创新的"思维压缩"机制。在"沉思模式"下,多智能体协作使推理性能显著提升。应用场景覆

《大模型训练中的超参数与学习率详解》一文深入解析了机器学习模型训练的核心要素。文章首先区分了模型参数与超参数的概念,指出超参数是训练前设定的配置变量,如同烹饪前的菜谱规则。重点讲解了神经网络的关键超参数体系,包括学习率、批大小、隐藏层数量等,其中学习率被比作下山时的"步幅",过大过小都会影响训练效果。文章详细介绍了学习率的三种状态及其影响,并提供了四种优化方法:网格搜索、学习率

DeepSeek推出DSpark系统实现大模型高效生成,通过半自回归架构和置信度调度验证两大创新显著提升推理速度。系统采用并行主干DFlash生成草稿,结合轻量顺序头注入token依赖,缓解传统推测解码中草稿质量差的问题;同时引入硬件感知调度器动态裁剪低置信后缀,避免无效验证拖累系统。线上实测显示,V4系列模型生成速度提升60%-85%,吞吐量提高51%-661%,在维持无损解码的前提下将服务性能

腾讯混元团队推出轻量级专家模型HunyuanOCR,以1B参数在OCR领域超越235倍参数量的通用大模型,实现端到端多任务处理。该模型在CVPR2026发表论文,获ICDAR2025竞赛冠军,在文档解析、信息抽取等任务上系统性领先。支持vLLM和Transformers部署,硬件要求低至4-6GB显存,通过prompt控制任务类型。其成功印证了"专精优化"路线在垂直领域的优势,

这篇文章通过小白和小黑学习Python的比喻,生动地解释了AI大模型的训练过程:1. 预训练阶段(大量阅读积累基础)- 模型学习语言规律但不会应用;2. 监督微调(模仿老师示范)- 学会标准应答格式;3. 强化学习(考试奖励机制)- 通过反馈提升能力,但存在奖励错位问题;4. PPO算法(私人顾问)- 引入价值网络稳定训练但成本高;5. GRPO算法(同学互评)- 用组内比较替代顾问降低资源消耗;

摘要: 开源AI模型Ornith-1.5通过自我改进循环技术实现突破:它能够自主识别能力短板,生成适配难度的训练任务,并自我验证与优化。其397B参数版本在编程测试(SWE-bench)中以86分追平商业巨头Claude Opus,而仅9B参数的轻量版性能甚至超越Google Gemma 4-31B。这一成果标志着开源模型首次逼近闭源顶尖水平,且揭示了AI进化的新范式——无需海量人工标注数据,通过

OmAILab开源视觉模型VLX-Seek提出创新架构,解决多模态大模型在细粒度感知上的核心难题。该模型将目标定位任务从"生成坐标"转变为"选择区域",通过候选区域生成、混合细粒度编码和语言模型推理三个步骤,显著提升了定位精度和稳定性。仅3B参数的VLX-Seek在多项基准测试中超越Gemini、Qwen-VL等大模型,特别在开放词汇检测和指代表达理解任务上

OmAILab开源视觉模型VLX-Seek提出创新架构,解决多模态大模型在细粒度感知上的核心难题。该模型将目标定位任务从"生成坐标"转变为"选择区域",通过候选区域生成、混合细粒度编码和语言模型推理三个步骤,显著提升了定位精度和稳定性。仅3B参数的VLX-Seek在多项基准测试中超越Gemini、Qwen-VL等大模型,特别在开放词汇检测和指代表达理解任务上








