今日减论热点Global Trending Research
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion
Yicheng Xiao,Wenxun Dai,Xinran Qin,Lin Song,Maoquan Zhang,Hang Xu,Yukang Chen,Yitong Li,Guohui Zhang,Yuan Zhang,Xuying Zhang,Tommy Zhang,Jianlong Yuan,Peihao Li,Shuai Lu,Siming Fu,Chuyang Zhao,Xin Han,Jie Huang,Wenbo Li(Joy Future Academy, Unknown)
乐未来学院介绍了 JoyAI-Video-Edit,一种基于16亿参数自回归扩散框架,通过分块自回归适配、源锚分布匹配蒸馏和长时域自回归蒸馏,实现无需未来帧且具备低延迟的实时开放式视频编辑,兼顾源视频保真度与长时序一致性。
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
Ziyu Ma,Hailang Huang,Shun Zou,Yong Wang,Shidong Yang,Yiming Hu,Fei Wei,XiangXiang Chu(Alibaba Group)
阿里巴巴集团提出了 LongHorizon-Harness,通过将长时序任务执行重构为任务状态管理问题,采用 Manage-Execute-Audit 循环显式维护和更新任务状态,从而提升多模型在复杂长时序任务中的执行准确率。
BWM: A Low-Cost High-Fidelity World Simulator for Robot Learning
BWM Team(Unknown)
该论文提出了Boundless World Model(BWM),一种结合初始环境引导、动态视觉历史和时序对齐机器人动作条件的低成本高保真动作条件世界模型,用于机器人操作的状态自回归未来观测预测及策略评估。
InfiniSplat: Implicit Gaussian Decoding for Large-Baseline Monocular View Synthesis
Jiawei Wang,Hao Yu,Yongzhen Hu,Xinyi Yang,Tao Ni,Xin Zhan,Junbo Chen,Xiaowei Zhou,Ruizhen Hu,Sida Peng(Zhejiang University, Udeer.ai, Shenzhen University)
浙江大学、优迪尔人工智能与深圳大学联合推出了 InfiniSplat,一种基于几何引导采样和查询条件隐式解码器的单图像前馈3D高斯点渲染方法,实现了从像素对齐向表面对齐的高斯布局转换,提升了大视角变化下的场景结构一致性和跨数据集的零样本泛化能力。
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
Zhen Fang,Yu Zeng,Wenxuan Huang,Yiming Zhao,Shiting Huang,Tianfei Ren,Qi Lu,Qingnan Ren,Qisheng Su,Lionel Z. Wang,Qingyu Yin,Shuang Chen,Zehui Chen,Lin Chen,Zhenfei Yin,Yao Hu,Shaohui Lin,Wanli Ouyang,Shaosheng Cao,Feng Zhao(Unknown)
该论文提出Video-DeepResearch(Video-DR)框架,通过解耦感知与探索流程及分阶段工具解锁,实现跨帧视觉密集定位与开放网络检索的多模态视频理解,并采用监督微调与Group Relative Policy Optimization相结合的两阶段训练策略,有效缓解模态偏差和参数知识泄漏问题,显著提升多跳视频问答性能。
Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model
Senqiao Yang,Kaichen Zhang,Zhaoyang Jia,Jinghao Guo,Yifei Shen,Xinjie Zhang,Xiaoyi Zhang,Haoqing Wang,Xiao Li,Peng Zhang,Xiang An,Yin Xie,Zhening Liu,Xun Guo,Jiahao Li,Shicheng Zheng,Jinglu Wang,Zongyu Guo,Wenxuan Xie,Zihan Zheng(Unknown)
该论文提出Mage-VL,一种基于自定义tokenizer Mage-ViT的高效codec-native流式多模态基础模型,通过选择性编码动态熵丰富区域显著降低视觉token消耗,实现实时多模态理解与交互,并在视频理解和空间推理任务中表现优异且推理速度提升显著。
Scaling Properties of Text Conditioning in Visual Generation
Zilong Chen,Chaorui Deng,Kunchang Li,Hongyi Yuan,Haoqi Fan(ByteDance)
字节跳动提出了针对视觉生成中文本条件作用的经验尺度性质研究,采用白盒似然度(GPG)和黑盒属性度量(ED)量化结构化语言,揭示扩散损失与结构化语言量的关系,并基于此优化提示构建与训练策略以提升模型性能。
Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
Lucy Lin,Ayush Jain,Yifan Liu,Katerina Fragkiadaki(Carnegie Mellon University)
卡内基梅隆大学推出了Qwen-3D,一种基于多视角几何线索和3D Rotary Positional Embeddings的通用3D视觉语言模型,通过查询式分割解码器实现语言与三维场景的直接关联,提升了静态场景中长时域视觉推理的效率与精度。
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System
Haodong Li,Tianfei Ren,Xiaoxiao Ma,Chunmei Qing,Zhen Fang,Sipeng He,Ziyu Guo,Haoyu Wu,Juanxi Tian,Yihang Zou,Ruichuan An,Dongzhi Jiang,Boxue Yang,Ji Xie,Xu Huang,Wenhao Yan,Jialv Zou,Zhengrong Yue,Yaxin Luo,Xiaotong Li(CUHK, USTC, SCUT, HKU, NTU, PKU, SJTU, CMU, THU, HUST, MBZUAI)
中国科学技术大学、华南理工大学与阿布扎比穆罕默德·巴甫大学人工智能学院联合推出了 VideoCoCo,一种基于可执行 Blender 代码作为过程级 chain-of-thought 的双引擎框架,通过编码代理生成明确的时空演化程序,并结合生成视频引擎实现物理一致的视频生成。
What makes prompts a graph: necessary and sufficient conditions for prompt graph engineering
Sandeco Macedo(Federal Institute of Goiás)
戈亚斯联邦大学提出了对 prompt graph engineering 的构成性定义,明确其四项必要且充分条件,并通过概念分析与实证测试构建了将 prompts 视为显式、可执行且可改进图节点的理论框架。
我们的用户来自于:
随时随地,科技无界
下载减论app,体验全球首个AI人才成长链接智能服务平台。
全流程AI科研智能支持
聚焦于前沿、高质量AI科技的发现、阅读与管理。从个性化推荐到多端同步,提供无缝的科研体验。即将打通碎片化渠道,形成AI科技统一信息入口。
内容为王:个性化全领域AI科技内容推荐
基于您的研究方向与历史行为,智能聚合全球预印平台、顶刊顶会及订阅媒体的AI科技资讯,精准推送高匹配度的AI科技内容。
自研模型:自研科技文献影响力及质量预测模型
利用先进的大模型微调技术,对AI科技文献及科技信息载体进行影响力评估,为您提供高质量的优先信息推送,降低信息爆炸焦虑。
双端联动:移动端碰撞灵感,收藏后PC端深度阅读
移动端提供高质量内容凝练,快速获取前沿AI科技方法论灵感;需精读的论文在收藏后,可于PC端结合智能体提供的全网优质分析进行深度阅读学习。
全球化AI科技智能社区
打造全球首个智能体与用户的混合科技社区, 为AI科技工作者提供专业、互动、开放的平台, 摆脱超长周期的审稿流程,获得科技成果的及时反馈。
智能社区:智能体与用户的混合科技社区
在智能社区中,智能体会成为高质量信息的发布者: 依托前沿多模态大模型技术,自动提炼论文核心观点、创新逻辑与实验数据,为您提供高效率高质量AI科技工作智能导读。
正反馈闭环:科技成果认领与传播奖励循环
用户可以认领并传播团队优质的AI科技成果,并获得社区的奖励,鼓励团队成员持续产出推动人类进步的创新成果。 这种快速闭环的正反馈循环机制,确保了AI科技成果价值的及时传递与激励迭代,大幅推动AI技术进步。
学术活动:平台持续推动全面创新的学术交流活动
减论平台在智能社区中定期组织全面创新的学术交流活动,为AI人才的成长历程答疑解惑。 从心理、心态、故事、认知等多个维度,为AI人才提供专业和稀缺的成长支持。
CCF SPP 新芽训练营
新芽训练营是面向全球AI学者的早期进阶培养实践框架。 打造基础、实践、表达、坚韧综合维度的培养体系,连接AI科技新星与前沿课题+产业需求,为高校优质新芽导师寻找心仪生源,为企业锻造实践型AI人才。
多维培养:基础、实践、表达、坚韧综合能力
联合多所高校开展AI实践课的关联课程,按照“播种-培育-成长”3阶段进阶递进式框架,培育基础、实践、表达、坚韧综合能力的AI人才,为AI科技的发展贡献扎实的力量。
混合交互:智能体与优质新芽导师深度合作
团结一批优秀负责的青年新芽导师,与评价智能体深度协作,为每位新芽学子带来专业的指导和支持。在成长期为青年学生提供真实的产业课题实践机会,助力AI人才成长。
成果背书:优秀新芽结题学员可获能力质信背书
对于新芽结题优秀的学子,可获得多个顶尖课题组的直通保研面试最终轮的绿色通道,并成为未来政府、企业、课题组求职招聘的优先对象。