栏目上新
推荐专题
教AI“听懂“音乐:一个不需要乐理知识、却能理解和声与乐句结构的钢琴卷帘世界模型
这篇论文提出了一个自监督分层音乐理解模型,训练于MIDI钢琴卷帘图像,无需任何乐理标签,能自动学出乐句结构和音符细节;配合流匹配生成模型实现CPU可运行的音乐建议与图形化补全功能,服务于人机协作创作而非替代人类。
亚马逊Prime Air无人机配送服务将大幅扩展覆盖范围
亚马逊宣布计划将Prime Air无人机配送服务大幅扩展,年底前将覆盖佐治亚、俄亥俄、伊利诺伊、爱达荷和纽约等都市区,服务城市数量将增至近500个。该服务支持配送重量不超过5磅、能装入大鞋盒的商品,涵盖平台逾60%热门商...
当AI看图说话时,它真的在“看“吗?
这篇论文发现多模态大模型存在"模态失衡"问题,即模型回答时过度依赖文字而忽视图片。研究者提出OPD-V方法,用放大图正向教师和遮挡图负向教师对比打分,筛选出真正依赖视觉的词元进行针对性训练,使4B小模型准确率超越千亿参数...
Stripe收购AI模型路由平台OpenRouter,交易额据报超75亿美元
Stripe宣布收购AI模型路由初创公司OpenRouter,据报道交易金额约75亿美元以上,主要以股权支付。OpenRouter拥有超400个模型、80余家供应商,日均处理超10万亿Token,服务逾千万开发者。其核心...
当学生怎么学都学不会时,问题可能出在“教材“上
SKILL-KD 提出了一种让弱 AI 智能体变强的新方法:不直接照搬强模型的示范,也不只看弱模型自己的错题,而是对比二者的行为差异,提炼成可验证、可迭代的文字技能补丁,并通过带证据链的整合机制防止技能库随时间劣化。
ChatGPT新功能:无需截图即可记住你在Mac上的操作
OpenAI为macOS版ChatGPT推出"电脑历史"新功能,面向Pro、Business和Enterprise用户开放。该功能在用户授权下,通过捕捉点击、输入、应用切换等交互事件,而非截图或录音,记录用户跨应用的操作...
当注意力机制悄悄失明:ALiBi位置编码里藏了三年的数字陷阱
这篇论文发现,广泛使用的ALiBi位置编码存在一个被忽视三年的数字下溢缺陷,导致部分注意力头在远距离词语间彻底失明而非渐进减弱,研究者通过预训练模型检测、自建1.48亿参数模型对照实验及四种补救策略测试,揭示了这一缺陷对...
Pixel Watch 4 深度评测:设计与功能的完美融合
谷歌Pixel Watch 4售价350美元,主打全面升级:41mm版续航达30小时,新型充电底座20分钟可充至60%;双芯片架构搭配Wear OS 6带来更高效能;卫星紧急通信功能(仅蜂窝版)让其成为目前最低价支持该功...
语言会变,但四种“器官“是一起变老的吗?一项跨越223年、五种语言的实验给出了答案
这项研究提出了CHRONOLENS框架,用crosscoder技术把不同语言、不同历史时期的语言特征对齐到同一空间,分析了五种语言两百多年议会文本中形态、句法、语义、语用的历史变化。发现同一语言内部四个层面变化幅度相近,...
AVEVA CEO:可持续发展承诺必须以可量化的成果为支撑
随着AI数据中心需求持续加剧电网基础设施压力,AVEVA首席执行官卡斯帕·赫茨伯格指出,行业应对不能止步于可持续发展承诺,而需提供可验证的运营透明度与量化绩效数据。他强调,数字孪生技术与标准化指标——而非空洞承诺——将决...
当AI做财务分析时,它到底是在算账,还是在装懂?
这篇论文提出FININDICES基准,用未裁剪的真实财报(最长32K token)测试大模型财务推理能力,发现模型存在知识瓶颈(去掉公式提示准确率腰斩)和结构瓶颈(生成复杂表格时推理能力被削弱),而监督微调能有效缓解这些...
Cognition CEO否认SpaceX收购传闻,称公司不出售
据彭博社报道,SpaceX曾试图收购AI编程初创公司Cognition,但该公司CEO Scott Wu随即在X上否认,称报道不实,公司"不出售"且双方未有谈判。此前SpaceX已完成对AI编程工具Cursor的600亿...
AI助手真的会“越用越懂你“吗?一份专门用来戳穿这件事的成绩单
PAST-Bench是一份专门检验AI个人助理"越用越懂你"这句承诺是否成立的评测基准,通过跨会话对照实验拆解记忆、流程复用、信息收集、更新四种能力,并提出Hermes+框架针对性修复了多个持久化机制的设计缺陷,发现同样...
OpenAI推出隐私安全处理功能,与Anthropic展开竞争
OpenAI近日预览了一项名为"私密安全处理"(Private Safety Processing)的新功能,旨在监测滥用行为的同时不留存任何客户数据。此举被视为针对Anthropic近期宣布的数据留存政策的竞争性回应—...
视频里的动作,光流一眼就看穿了
2014年,深度学习在视频动作识别上还打不过手工特征方法。Simonyan和Zisserman提出双流卷积网络,把网络拆分成处理画面的空间流和处理光流运动信息的时间流,两者融合后准确率达到88%,首次追平甚至反超了当时最...
利用CLI、技能与AI编码智能体开发NVIDIA Holoscan应用
NVIDIA Holoscan是面向边缘端实时AI应用的开发平台,涵盖医学影像与机器人等领域。本文介绍如何借助AI编码智能体构建实时内窥镜工具分割应用,通过HoloHub示例、开发文档与Holoscan CLI协同驱动开...
视频编辑这件事,正在从“剪辑室“搬到“直播间“
京东团队提出JoyAI-Video-Edit,一款160亿参数的自回归扩散视频编辑模型,通过分块因果建模、源锚定蒸馏和长时程优化三项技术,实现无需预知时长的实时开放式视频编辑,在B200 GPU上达到720p、30FPS...
应用可靠性初创公司 Temporal 据报正在洽谈 5 亿美元融资
应用可靠性初创公司Temporal Technologies据报道正洽谈新一轮约5亿美元融资,估值或超120亿美元,较今年2月上轮融资翻逾一倍。Temporal提供开源平台,可在应用崩溃后通过时序日志从断点续跑工作流,尤...
视频里的动作,AI是怎么“看懂“的?
2014年,深度学习在视频动作识别上一直打不过传统手工特征方法。牛津大学Simonyan和Zisserman提出双流卷积网络,把视频拆成空间流(单帧图像)和时间流(光流场)分别处理再融合,首次让深度学习在UCF-101和...