Weekly Report 2026-05-24

工作任务

论文/学报阅读

阅读:RFCAUDIT: AI Agent for Auditing Protocol Implementations Against RFC Specifications

工作进展

当前IDEA和现有工作的区别 – 1.精读:RFCAUDIT: AI Agent for Auditing Protocol Implementations Against RFC Specifications

核心insight

0. LLM为中心的,通过网络RFC手册找到功能bug的静态检测工具

1. 提前用LLM给整个项目建立index

2. 使用retrieval-guided detection,不断迭代获取需要漏洞检测的代码上下文
3. 上述insight都是通过学习人类是如何从手册找到代码中的inconsistent的workflow从而想出来的

Code semantic index

自下(function)而上(file,dir,repo)给每一个层级建立1-2行的描述
(疑惑:每一个function如果需要有关的的数据结构描述怎么办(后面发现这个工作在后面的retrieval部分)?如果这个funtion call了另一个,但是另一个的描述还没建立怎么办?(我认为可以通过迭代数据库解决))

retrieval-guided detection preprocess

将手册首先分成每个小subsection,给每一个小subsection提取一个或多个semantic properties
(疑惑:subsection之间如果有依赖怎么办?这个preprocess是不是可以建立一个长期数据库,如果有新的commit改变了某个properties就意味着需要重新扫描?)

retrieval-guided detection

对每一个semantic properties,进行这么几步:Localization ,Detection,Retrieval,Validation

  • Localization:自上而下递归定位
  • Detection:给llm三个选项,conform, violation, unkown,以选择进入下一个状态
  • Retrieval:(最有insight的部分)他给这个agent定义了三个预定义的工具,Query(name), Query_callee(call), Query_caller(func),分别去增量获取数据结构、其他函数,以增加当前分析的context
  • Validation, 验证当前的分析结构是否是误报(个人认为这里需要的模型需要性能最强)(或者把模型的推理过程形式化验证)
一些小细节
论文完整性启示

一.论文提了四个问题并回答他们,以测定这个工具的有效性

  • <u>RQ1: How effective does RFCAUDIT identify functional bugs in real-world network protocol implementations?</u>
    分成三个部分来回答:

    1. The Effectiveness of Bug Detection
      A: 81 bugs,81.9% true positive, 47 unique bugs
      2.The Effectiveness of Context Retrieval
      分为precision和recall,他的precision不高,只有50%,但是recall在retrieval阶段比较高,证明其找的全但是找了很多没什么用的context,增加了cost(可以改进)
      3.False Positive Analysis
      主要是对代码和RFC的含义解读存在问题,还有就是没有找全context
  • <u>RQ2: How does RFCAUDIT compare to existing approaches?</u>
    和GitHub Copilot对比:和更强的模型对比,准确性更高
    和LTL-Fuzzer相比:与传统的手册漏洞检测工具做对比

  • <u>RQ3: What are the runtime and token costs of RFCAUDIT?</u>
    主要检测了他的token,运行时间

  • <u>RQ4: How do the two agents contribute to performance?</u>
    使用Ablation Study
    1.移除Code Semantic Indexing.
    2.移除retrieval的detection
    3.移除validation

二、Case study

三、Threats to Validity.

1.模型质量
2.人工审查
3.文档质量

四、Related work

1.侧重网络漏洞检测
2.侧重LLM辅助的静态漏洞检测
两大方向 1.llm辅助,传统分析引擎当主力(knighter) 2.LLM为中心的漏洞工具 (可以找几篇来精读一下)

改进当前工具 -1.查看大语言模型的准确性,稳定性

我觉得我现在的工具比较粗糙,只是claude加上prompt以及一个简单的workflow

改进他可能没有什么价值,但是他的价值是对比实验

可以论证,只用通用agent – claude code和用我们专用的agent,准确率和找的bug有什么区别,是否专用的agent效果更好

2026-09-08 · Also readable in terminal: ssh blog@www.yizishun.com then run blog security/riscv-linux-security/weekly-reports/2026-05-24

Comments

Loading…

    Connecting to real terminal…