SF
超神经HyperAI
超神经HyperAI
注册登录
关注博客
注册登录
主页
关于
RSS
HyperAI 新功能上线 | 为算力容器配置环境变量与 Secret 变量
超神经HyperAI
7 月 9 日
阅读 2 分钟
413
在日常的模型微调、推理部署或自动化任务中,我们经常需要与各种第三方服务、远程仓库进行交互,例如传入第三方服务的 Token、指定模型仓库地址、传入运行参数等。
在线教程|阿里千问团队开源首个原生语言世界模型,一个模型打通终端、网页与手机智能体交互
超神经HyperAI
7 月 9 日
阅读 3 分钟
471
在最新一轮 AgentWorldBench 评测中,一个仅激活 30 亿参数的模型悄悄反超了 Claude Sonnet 4.6——这就是阿里巴巴通义千问团队刚刚推出的「Qwen-AgentWorld-35B-A3B」。
OpenAI发布GeneBench-Pro,在129个问题/10个领域内评估AI科研能力
超神经HyperAI
7 月 8 日
阅读 5 分钟
421
与大多数工程任务不同,科学研究具有更强的迭代性、开放性与不确定性,其核心挑战不在于分析流程的执行本身,而在于科学直觉或「研究品味」所驱动的一系列判断:例如数据能够支持什么问题、应纳入哪些数据、选择何种估计量或模型、诊断结果是否推翻初始假设,以及在何种证据强度下可以得出结论。
从K-mer到自适应词元:厦门大学林琛团队让AI自动学习「基因功能边界」
超神经HyperAI
7 月 7 日
阅读 4 分钟
556
在生命科学与生物医学领域,高通量测序技术使基因组数据指数增长。当海量序列远超传统方法解析能力时,人工智能,尤其是深度学习和语言模型,正成为解读基因组「天书」的核心工具。AI 不仅能高效处理巨量数据、挖掘非编码区的调控语法,还在基因功能预测、疾病标志物、蛋白质结构和药物靶点等方面展现巨大潜力。AI 的持...
数据集汇总丨AI Agent 评测数据集,北大/港大/上海交大等发布 10 个数据集,从长程记忆到真实环境任务执行全覆盖
超神经HyperAI
7 月 7 日
阅读 4 分钟
528
在大模型能力不断扩展的当下,AI Agent 正从「对话工具」快速走向「任务执行者」,并开始在自动化办公、代码生成、数据分析与复杂流程处理等场景中被广泛应用。相比传统的问答式大语言模型(LLM),Agent 的核心变化在于:它不再只是回答问题,而是能够拆解任务、调用工具,并自主推进直至完成目标。
emoji 也能控制语音生成?Irodori-TTS 基于 RF-DiT 架构的日语 TTS;Eczema and Tinea Skin Disease 数据集:支持医学图像分类与迁移学习
超神经HyperAI
7 月 3 日
阅读 6 分钟
553
由开发者 Aratako 于 2026 年发布的开源项目 Irodori-TTS,是一款兼具高保真音质与极强操作性的新一代日语语音合成与零样本克隆模型。其 5 亿参数的核心基础模型 Irodori-TTS-500M-v3 基于连续 DACVAE 潜在空间与 RF-DiT 架构,在保证计算效率的同时能稳定输出 48 kHz 的专业级音频。在实际应用层面,该模型实现了两大突...
活动预告|智源/TileRT/腾讯/华为/智元创新同台,共探 AI 编译的多层级协同优化
超神经HyperAI
7 月 2 日
阅读 4 分钟
501
从北京的酷暑到上海的寒冬,由 HyperAI 超神经主办的 Meet AI Compiler 技术沙龙,已经伴随 AI 编译生态走过了三年。这三年里,我们见证了无数工程师与科研学者分享前沿成果、碰撞技术观点,也共同推动着编译技术在大模型时代持续演进,不断突破性能优化、异构适配与工程落地的新边界。
Meta 提出 AI 数据科学家,Autodata 构建高质量训练/评测数据集
超神经HyperAI
6 月 30 日
阅读 5 分钟
486
近年来,大模型能力的持续提升正在不断重塑人工智能的发展路径,但一个愈发清晰的共识是:模型性能的边界正在从「算法创新驱动」逐步转向「数据质量驱动」。在高质量人类标注数据日益稀缺、成本持续上升的背景下,合成数据逐渐成为后训练阶段的重要支撑方式,它能够生成在真实语料中较为稀缺的边缘案例与长尾场景;降低...
在线教程丨 32K 上下文一次解析数十页文档,百度开源 Unlimited OCR,重构长文档复杂场景
超神经HyperAI
6 月 29 日
阅读 3 分钟
486
过去几年,OCR 已逐渐从「识别图片里的文字」演变为完整的文档理解(Document Understanding)任务。企业和开发者不仅需要提取文本,还希望模型能够识别复杂版面结构、解析表格与公式、理解多栏排版,并最终输出适合下游 RAG 、知识库或办公自动化使用的结构化结果。然而,当处理扫描报告、论文、 PPT 、合同以及多页 PD...
从简单助手到强生产力,香港大学黄超团队的AI Agent落地攻坚实录
超神经HyperAI
6 月 26 日
阅读 4 分钟
719
近年来,大语言模型正在加速由对话工具迈向自主智能体,OpenClaw 等成为这一转变的重要里程碑。但当 Agent 试图介入真实生产环境时,核心矛盾日益凸显:是让 Agent 被动适应人类现有的图形界面与操作逻辑,还是为 Agent 重新设计数字世界?
4 步出图/4K 画质/6 倍提速,PiD 用像素扩散统一解码与超分辨率输出;SA-3DAO:包含 1000 组真实图像与艺术家手工 3D 网格配对的数据集
超神经HyperAI
6 月 26 日
阅读 8 分钟
582
PiD 是 NVIDIA 发布的一种全新潜空间解码范式,将传统的 VAE 解码过程重新定义为条件像素扩散生成,把解码与超分辨率上采样统一到单一生成模块中。传统潜扩散模型通过 VAE 将潜变量还原为图像,输出分辨率受限,且重建导向的解码器难以补全高频细节、无法纠正潜变量中的伪影。 PiD 引入轻量级噪声感知潜变量适配器(sigm...
在线教程丨 UC 伯克利/英伟达等发布 3DGS 开源库 gsplat,节省 4 倍显存,训练时间缩短 10%
超神经HyperAI
6 月 25 日
阅读 3 分钟
674
自 2023 年《3D Gaussian Splatting for Real-Time Rendering of Radiance Fields》横空出世以来,3DGS(3D Gaussian Splatting)迅速成为三维重建与新视角合成领域最受关注的技术路线之一。相比传统 NeRF,3DGS 在渲染速度和视觉质量上取得了突破性进展,使实时高保真三维场景重建成为可能。然而,随着研究和产业应用的...
材料 AI 迈向「可解释时代」,日本团队破解高维光谱黑箱,锁定新材料发现关键特征
超神经HyperAI
6 月 23 日
阅读 5 分钟
521
近年来,机器学习在材料科学领域的应用备受关注,其应用已从早期的结构–性质标量预测(如带隙能量、点缺陷形成能、熔点等)逐步扩展到更复杂的高维物理量建模,其中最具挑战性的方向之一便是材料光谱的预测与解析。
当AI开始做研究,人类科学家还剩下什么?清华团队打造AgentSociety²人机协同研究环境
超神经HyperAI
6 月 22 日
阅读 7 分钟
543
当 AI Scientists 开始进入科学研究,一个新的问题随之出现:如果 AI 已经能够读文献、生成假设、设计实验、运行仿真、分析结果,甚至撰写论文,人类研究者还应该站在哪里?
基于 Gemini 1.5 长上下文能力,谷歌对话式医疗系统 AMIE 在 100 例多次就诊场景中达到全科医师的推理水平
超神经HyperAI
6 月 22 日
阅读 5 分钟
622
大语言模型正加速进入医疗健康领域,其应用已从文献检索、病历生成延伸至临床决策支持。其中,辅助诊断是当前较为成熟的方向之一:经医学微调的模型能够基于病史、体征和检查结果给出较高质量的鉴别诊断;具备多轮对话能力的系统,也可通过问诊式交互补充病史信息。
论文周报 | DeepMind D4RT 统一动态 4D 重建,推理速度飙升 300 倍;打破 AGI 通用幻想,哥大等提出 SAI 理论重塑 AI 演进目标… 速览一周 AI 前沿论文
超神经HyperAI
6 月 18 日
阅读 4 分钟
733
理解和重建动态视频中的复杂几何形状与运动轨迹,一直是计算机视觉领域的重大挑战。传统的解决方案往往依赖碎片化的特定任务模型拼凑,或是深陷于计算昂贵的逐帧迭代优化之中。为此,Google DeepMind 联合牛津大学与伦敦大学学院(UCL)的研究团队彻底颠覆了刚性的帧级解码思路,提出了一种简单而强大的前馈统一框架 D4R...
在线教程丨香港科技大学团队开源首个确定性视频深度框架 DVD,零样本刷新 SOTA
超神经HyperAI
6 月 18 日
阅读 2 分钟
762
深度估计是三维视觉领域最基础也最关键的任务之一。从自动驾驶、机器人导航,到 AR/VR 、数字孪生和视频内容生成,系统都需要准确理解场景中物体与相机之间的空间关系。然而,视频深度估计长期面临一个难以调和的矛盾:以扩散模型为代表的生成式方法拥有强大的语义理解能力,能够借助海量预训练数据推断复杂场景结构,但...
支持真人、动漫与动物驱动,美团开源多风格音频驱动视频生成框架 LongCat 1.5;百万级图表理解数据集 ChartNet,提升 VLM 图表重建与表格提取能力
超神经HyperAI
6 月 16 日
阅读 4 分钟
882
LongCat-Video-Avatar 1.5 由美团 LongCat 团队于 2026 年 5 月推出,是一款全新的开源音频驱动视频生成(AI2V)框架。用户仅需提供一张静态参考图和一段音频,即可生成口型精准同步的动态化身视频。该模型采用 Whisper 驱动的语音特征提取;步数蒸馏技术将 DiT 生成过程压缩至极速的 8 步,不仅保证高保真画面,还能生...
谷歌 DeepMind 最新论文揭秘 AI 终局:从 AGI 到 ASI,有 4 条路和 6 道关
超神经HyperAI
6 月 15 日
阅读 5 分钟
776
过去十年,人工智能的发展速度不断刷新人们的预期。曾经还停留在科幻设想中的 AGI,正在成为许多大型 AI 机构面向未来十年的明确目标。但一个更值得追问的问题是:如果 AGI 真的到来,AI 的发展会停在那里吗?
在线教程丨最高 4 倍生成速度提升,DiffusionGemma 可同时生成整块文本,基于多轮并行去噪持续优化结果
超神经HyperAI
6 月 12 日
阅读 3 分钟
900
6 月 11 日,Google 正式开源了基于离散扩散(Discrete Diffusion)技术构建的文本生成模型 DiffusionGemma 。其基于 Gemma 4 系列领先行业的「参数效率智能性」(intelligence-per-parameter)以及前沿的 Gemini Diffusion 研究成果打造,并集成了全新的扩散解码头(Diffusion Head),以最大化生成速度。与传统大模型...
麻省理工/IBM 提出迄今为止最大的合成图表数据集 ChartNet,生成 150 万个多样化图表样本
超神经HyperAI
6 月 11 日
阅读 5 分钟
806
过去两年,多模态大模型的发展速度远超预期。从识别图片内容,到理解复杂文档,再到解析视频信息,视觉语言模型(VLM)不断突破能力边界。然而,有一种看似简单却极具挑战性的视觉对象,至今仍让许多先进模型频频「翻车」——图表(Chart)。
剑桥大学等提出面向对地观测任务的像素级基础模型,在多项任务中精度达 SOTA
超神经HyperAI
6 月 10 日
阅读 4 分钟
899
对地观测卫星能大范围、长周期监测地球,已成为农业生产、森林管护、生态监测、国土治理等领域的关键工具。利用卫星获取的长时序遥感数据,研究人员可以追踪地表动态变化。但真实的卫星观测数据远非完美:云层遮挡、轨道重访周期不规则、传感器分辨率不匹配、设备噪声等干扰,导致原始数据残缺、异构、无序,难以直接用...
在线教程丨 16GB 笔记本跑出接近 26B MoE 性能,Gemma 4 12B 基于创新架构统一处理文本/图像/声音三种模态
超神经HyperAI
6 月 10 日
阅读 3 分钟
945
近日,Google DeepMind 正式发布 Gemma 4 家族最新成员——Gemma 4 12B 。这是一款仅有 120 亿参数的统一多模态模型,却在多项基准测试中展现出接近 260 亿参数混合专家(MoE)模型的性能。官方数据显示,Gemma 4 12B 在推理、代码生成以及多模态理解等任务上的表现已逼近 Gemma 4 26B,同时在部分视觉理解和 Agent 任务中...
论文周报 |微软 MAI-Thinking 探索纯 RL 自我进化,AIME 准确率达 97%;无需架构修改,VLM³凭纯文本坐标实现 3D 任务泛化… 速览一周 AI 前沿论文
超神经HyperAI
6 月 8 日
阅读 5 分钟
1k
人工智能的进步不仅依赖于单一模型的突破,更在于如何构建能够持续自我提升的系统。为此,微软 AI 团队将模型开发视为一个系统级优化问题,提出了一种旨在实现快速且持续性能提升的「爬山机器 (hill-climbing machine) 框架」,并基于此从零开始训练了总参数 1T 、激活参数 35B 的 MoE 推理模型 MAI-Thinking-1 。
深度估计准确率冲上 0.9,Meta 提出 VLM³,论证视觉模型天生会学 3D,以 Qwen3-VL-4B 为基础实现多任务的统一建模
超神经HyperAI
6 月 8 日
阅读 4 分钟
961
三维空间感知是自动驾驶、机器人、三维重建等领域的核心基础能力,其目标是从二维图像中恢复真实世界的空间结构、尺度信息与几何关系。与图像分类、目标检测等二维视觉任务相比,三维感知不仅要求语义理解能力,还需要精确的空间推理与几何建模,因此长期以来被视为计算机视觉领域最具挑战性的研究方向之一。
MiniCPM5-1B 采用 RL+OPD 训练,多项复杂任务达 SOTA;面向复杂医疗业务自动化:医疗智能体评测数据集 CHI-Bench 发布
超神经HyperAI
6 月 5 日
阅读 4 分钟
1.2k
MiniCPM5-1B 是由 OpenBMB 开源的一款专为端侧部署和资源受限场景设计的 10 亿参数级语言模型,也是 MiniCPM5 系列的首款模型。该模型基于标准 Llama 架构,引入了包含 <think> 标签的混合推理范式。此外,该模型借助先进的 RL+OPD 训练工艺,在大幅提升核心性能的同时有效消除了输出冗余。其原生支持 131K 超长上...
基于 220 种海洋细菌,科学家用基因组尺度模型重构异养微生物分类体系,挖出 8 类代谢菌群
超神经HyperAI
6 月 5 日
阅读 5 分钟
1.2k
森林被誉为地球之肺,海洋则是地球之心。广袤大洋中数以万计的微生物组成复杂群落,依靠各自独特的代谢分工调控有机质转化,驱动碳固定与碳释放过程,深刻左右全球碳循环、气候变化与海洋生物多样性。其中,海洋异养微生物犹如海洋生态系统中的「净化单元」,承担着有机质降解的核心功能,从而维系全球物质循环与生态平衡。
Free CPU 教程丨西湖大学张岳团队开源科研插图神器 AutoFigure,可精准理解长篇科学文本
超神经HyperAI
6 月 3 日
阅读 3 分钟
1.3k
在科研论文中,一张优秀的示意图往往胜过数百字的文字描述。无论是深度学习模型架构、生物学机制流程,还是复杂的实验设计与技术路线图,科研插图都是帮助读者快速理解核心思想的重要载体。
在线教程丨英伟达开源 LocateAnything,3B 模型可实现图像+视频的目标指向/开放词汇目标检测/指代表达定位/OCR 文本定位等功能
超神经HyperAI
6 月 2 日
阅读 3 分钟
1.9k
随着视觉语言模型(VLM)持续向 Agent 、多模态交互和现实世界任务演进,「看懂图片」已经不再是终点,更重要的是「准确找到目标在哪里」。无论是开放词汇目标检测、 GUI Agent 的界面操作、文档理解,还是机器人与自动驾驶系统中的环境感知,都对视觉定位(Visual Grounding)能力提出了越来越高的要求。
研发周期缩短 70% 以上!新加坡国立大学提出 AI-计算化学协同流程,加速糖尿病创面愈合药物重定位研发
超神经HyperAI
6 月 2 日
阅读 5 分钟
1.3k
在当前临床诊疗中,糖尿病创面尤其是糖尿病足溃疡(DFU)的救治依旧是一项「久攻不破」的难题。长期居高不下的血糖致使患者创面迁延不愈,严重者甚至可能面临截肢风险。与此形成显著对比的是,靶向治疗此类病变的纳米药物研发工作却是困难重重:面对数量庞大的候选药物分子与创面愈合过程中蛋白质间繁杂的互相作用,传统...
1
(current)
2
3
4
5
…
More
下一页
1
(current)
下一页