FJAIResearch StudioResearch online

FJAI

AI 论文日报 · 2026-07-10

覆盖北京时间 2026-07-09 / 2026-07-10。聚焦 Agent、LLM reasoning、RAG、评测、训练与推理基础设施。

candidate count
287
new included count
286
selected count
15

Top 3

  1. Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing — 与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。
  2. UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks — 与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。
  3. Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems — 与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。
#1

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#2

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#3

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#4

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

Shilin Ou, Yifan Xu, Luyao Zhang · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#5

OpenCoF: Learning to Reason Through Video Generation

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#6

PolyUQuest: Verifiable Structure-Aware Web RAG over Heterogeneous Graphs

Ying Liu, Yi Ye, Quanyu Feng, Mingxi Ye · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#7

Out of Sight: Compression-Aware Content Protection against Agentic Crawlers

Xuefei Wang · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#8

MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction

Ao Hong, Lehang Wang, Zhirun Yue, Mingxin Wang · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#9

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#10

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#11

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt · 2026-07-07 · arXiv

一句话:提出新的模型、训练或推理方法,可能改善 LLM 系统能力或效率。

为什么重要:虽不一定是 agent 论文,但对模型能力、效率或可靠性有潜在影响。

Lucian 下一步:阅读方法与实验设置,判断是否能转化为训练/推理基础设施实验。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#12

OmniFood-Bench: Evaluating VLMs for Nutrient Reasoning and Personalized Health Advice

Qian Jiang, Zhecheng Shi, Jingpu Yang, Zirui Song · 2026-07-09 · arXiv

一句话:把复杂任务拆成可评估的 agent/多 agent 过程,适合作为长期 agent 系统的设计参考。

为什么重要:与 Lucian 关注的 agent planning、tool use、memory 或 long-horizon 执行直接相关。

Lucian 下一步:抽取其任务协议、记忆/工具接口与评测指标,映射到现有 agent 原型或 benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#13

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps

Tomasz Stanczyk, Yuan Gao, Hardik Agarwal, Seongroo Yoon · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#14

Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

Anh Trac Duc Dinh, Khang Nhat Hoang Vo, Vinh Cong Doan, Tai Tien Ta · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

#15

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato · 2026-07-09 · arXiv

一句话:提供新的评测集或评估协议,可用于检验模型/agent 的薄弱环节。

为什么重要:评测论文能快速转化成回归测试、数据集构造和 leaderboard 监控。

Lucian 下一步:复现其指标定义,挑 20–50 个样例做本地 smoke benchmark。

Relevance: 5/5;Novelty: 4/5;Substance: 4/5;Evidence: 4/5;Actionability: 4/5;Total: 21/25

arXiv · PDF

数据源与不确定性

HF Daily Papers 2026-07-09 failed;HF Daily Papers 2026-07-10 failed

Relevance · Novelty · Substance · Evidence · Actionability 均为 0–5 分。