Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

2 Commits
 
 

Repository files navigation

IPv6-Resources

IPv6拥有极为庞大的地址空间,传统穷举扫描(如ZMap、Masscan等)在IPv6中不可行,需要数亿年才能扫描完毕。因此,研究人员提出了各类IPv6目标地址生成算法(Target Generation Algorithms,TGA),通过分析已知的活动IPv6地址(种子地址)的分布模式,推测出更多可能活跃的地址以供扫描。这些算法旨在缩小扫描搜索空间提高命中率,从而更快速地构建IPv6活跃地址列表(hitlist)并支持拓扑探测、安全扫描等任务。本文将对近年来的IPv6地址生成算法进行深入综述,包括各算法的输入、输出、应用场景和性能指标,并对比分析它们的设计特点和适用性。

近年来IPv6地址生成算法大致分为三类:

  • 基于启发式/统计规则的方法:利用种子地址的结构和统计特征进行地址空间划分和扩展,通常采用规则挖掘或聚类等算法,无需深度学习模型支撑。
  • 基于学习的方法:运用机器学习或深度学习模型(包括强化学习和生成模型)从种子数据中学习IPv6地址分布,以生成新的候选地址。
  • 混合或动态方法:结合多种策略或引入实时扫描反馈迭代优化,有的将启发式算法与学习算法结合,有的在生成过程中动态调整参数,以兼顾探索新的地址区域和利用高密度区域。

接下来,小节1将详细介绍各类典型算法,归纳它们的输入输出和性能;小节2给出一张对比表格分析不同算法的类型、数据依赖、复杂度、可扩展性等;小节3则汇总提供相关算法的论文引用及开源实现地址。

启发式和统计模型算法

这类算法利用IPv6地址分配的结构特点统计规律进行目标地址生成,通常假设“种子地址的分布能反映潜在活跃地址的分布”。它们多基于聚类、模式挖掘或规则提取来推测高概率地址区域,输入主要是已有的种子地址集,少量算法也会利用基本的网络信息(如前缀分配表)作为辅助。输出一般是一系列预测的IPv6地址或地址前缀,有时以地址模式(带通配符的地址段)表示可扫描空间。应用场景集中在全网扫描前的候选集扩展(hitlist扩展)和扫描优先级优化。性能指标关注命中率(生成地址中真实活跃地址的比例)、覆盖率(发现的新地址占潜在总活跃数的比例)以及生成和扫描的效率。

Entropy/IP算法

Entropy/IP是早期提出的统计学习方法,由Foremski等人在IMC 2016提出。输入为一组已知IPv6地址(种子),算法通过计算各地址字段(nybble半字节)的熵来识别地址模式:将熵值相近的连续nybble组合为段,然后利用贝叶斯网络模型学习不同段取值之间的依赖关系。输出是根据学习到的统计模型生成的地址集合,特别是通过调整高熵段的值来合成新地址。Entropy/IP适用于拓展命中列表,场景上属于离线分析:先训练模型再批量生成地址供扫描。其性能在提出时代表了IPv6地址结构分析的先进水平,但也存在依赖大量种子才能训练出有效模型的弱点。例如,Murdock等比较了Entropy/IP与后来的6Gen算法的效果,发现Entropy/IP在种子较少时生成地址数量偏少。总体而言,Entropy/IP为IPv6地址生成引入了概率图模型的思路,其命中率取决于种子集中地址分配的规律性,当网络采用随机接口ID时效果会下降。

6Gen算法

6Gen由Murdock等人在IMC 2017提出,是一种利用分层聚类的地址生成算法。输入为一批种子地址,6Gen假设“种子高度聚集的区域往往蕴含更多活跃地址”。算法计算种子之间的距离(例如汉明距离),并基于相似度将种子进行凝聚层次聚类(AHC)以识别高密度地址簇。然后,以每个簇为中心,在簇所在的地址空间区域内生成邻近地址作为扫描目标输出是一系列地址,主要集中在与现有种子接近的地址块中。6Gen主要用于hitlist扩展,离线生成地址后再进行探测。其性能在多种数据集上优于Entropy/IP:Murdock等报告6Gen在部分数据集上可预测出种子数1~8倍的新地址,甚至对某网络数据集预测出超过99%的活跃地址。6Gen在一次实际扫描中通过DNS收集的种子生成了数亿候选地址,探测发现了超过5500万新活跃地址。不过,6Gen也有局限:种子偏差可能导致生成结果集中于已有分配区域,难以覆盖种子未涉及的前缀空间。

6Tree算法

6Tree由Liu等人在2019年提出。它采用自顶向下的划分策略,将种子地址加载到一棵地址空间树上(每层对应地址的一个nybble位),利用分裂聚类(DHC)迭代划分地址空间。具体而言,6Tree从根节点(表示整个地址空间)开始,不断按某一位上的通配符进行拆分,形成子空间,直至划分到叶节点或达到扫描预算。划分过程中参考了种子在节点上的密度:例如选择某层上种子分布最稀疏的nybble位作为切割点,将空间一分为二。输出为划分得到的各地址子空间中的地址集合,6Tree会优先扫描叶子节点所在的小空间,发现活跃地址后再向上合并区域继续扫描更大的范围。6Tree属于动态扫描算法:它一边构建空间树一边执行扫描,将反馈用于指导进一步的划分和合并。应用场景上,6Tree适合于有一定种子集合的情况下高效发现相邻地址;其设计还结合了IPv6中常见的大规模别名前缀问题——文献引入了一种别名检测以避免在完全响应的伪密集区域浪费探测包。在实验中,6Tree基于274万种子成功发现了约469万去别名后的活跃地址。总的来说,6Tree相较6Gen扩大了扫描覆盖范围,但对种子分布仍较敏感,过度依赖种子所在前缀时可能漏掉种子未覆盖的网络区域。

6Scan算法

6Scan由侯冰楠等人在2023年提出,是一种高效异步的IPv6扫描与目标生成集成算法。6Scan的特点是在目标地址生成过程中编码区域信息并结合实时反馈进行调整。输入上,6Scan需要初始种子地址集,通常利用已有hitlist或预扫描得到。其算法流程是使用DHC策略对地址空间进行划分(类似6Tree),为每个地址子空间分配一个区域标识符,并在发送探测包时将该标识符嵌入ICMPv6数据字段。探测进行时,6Scan以异步方式大量发送探测包,收集响应;输出则是在扫描过程中动态产生的活跃地址列表。6Scan的核心是利用返回包中携带的区域ID来统计各区域的活跃地址数量,从而实时调整扫描策略:增加高活跃度区域的探测比例,减少低活跃度区域的探测。这种强化反馈的机制使6Scan在大规模扫描中效率显著提高,一方面探测发送和接收解耦并行,充分利用带宽,另一方面通过“区域编码”实现了对扫描过程的精细控制。应用场景上,6Scan适用于持续的互联网测绘扫描,可在有限预算下尽可能覆盖活跃地址。其性能在论文中表现突出:相比传统方法提高了扫描效率,并成功发现大量活跃地址。由于6Scan动态适应网络反馈,被视为引入强化学习思想的扫描器之一(虽然未使用显式RL模型,但通过环境反馈循环调整扫描,相当于策略优化)。6Scan已在实际部署中使用,并提供了开源实现供社区参考(见文末链接)。

HMap6算法

HMap6是另一种由侯冰楠等人提出的方法,其名称来源于“IPv6 Hierarchical Map”。它采用双向层次聚类(BHC)来生成目标地址。具体而言,HMap6结合了AHC和DHC两种聚类策略的优点:既自底向上将密集种子聚合成簇,又自顶向下按地址空间划分种子以分离区域。这种双向结合能够生成更多有前景的扫描子空间,提高种子稀疏区域的覆盖。HMap6还优化了算法的时间复杂度,实现了较好的可扩展性。输入与6Gen类似需要种子集,输出为选定的若干地址子空间中的地址列表,可用于后续探测。HMap6的应用在于互联网规模的hitlist扩充和周期性扫描:它被集成进开源扫描器6Scan工具中,可作为一种TGA策略(参数“-s HMap6”)。在实际测量中,HMap6通过引入多种启发式策略组合,在保证精度的同时显著加快了候选地址生成,在大型种子集合上取得了较高的命中率。需要注意的是,HMap6仍属于离线聚类方法,对种子集质量有依赖,当种子非常有限时效果受限。

DET算法

DET(Distributed Entropy Tree)是Song等人在2022年提出的方法,可视为6Tree的改进和混合策略代表。DET综合了Entropy/IP的统计思想和6Tree的空间划分思想:同样使用DHC构建地址空间树,但在划分点选择上引入了熵指标,每次选择种子集nybble熵值最低的位置进行划分。这样做旨在优先使用稳定字段作为划分,从而减小对种子随机偏差的敏感度。DET还引入了分批迭代策略:生成一批目标地址进行扫描后,根据新探测到的活跃地址更新种子信息,重构空间树再生成下一批目标。这种循环过程持续数轮,逐步扩大覆盖范围。输入方面,DET需要初始种子集并不断将扫描结果并入种子。输出则是在每轮中产生的新候选地址集合。DET的应用场景主要是有一定种子但分布不均的情形下,希望通过多轮扫描提取更多地址。相比原始6Tree,DET更具自适应性,能够利用扫描反馈调整方向。然而,DET没有解决IPv6别名前缀问题,可能会因为别名区域的虚假高密度而偏离最优搜索方向;另外其每轮重建树的开销较大,在大规模实现时显得较为重量级,扫描耗时增加。

6Forest/6Probe算法

6Forest(有文献称之为6Probe)是近年提出的新颖方法,其思想是通过多个地址空间树构成“森林”来扩大可探测区域。与6Tree使用单棵树不同,6Forest尝试采用不同的划分策略构建多棵6ASTree,将各树生成的低维模式合集成为覆盖更大的地址空间。具体来说,算法对种子集应用多种DHC划分规则,得到若干不同的空间树,然后合并所有树中维度≤4的低维节点作为目标地址模式集合。这些模式再展开生成地址并去除别名地址后进行探测。6Forest通过把原本种子不足的“丢失模式”区域转换为可扫描的低维模式,显著增加了可覆盖的地址空间。输入仍为种子地址,输出是一批优选的地址模式及对应候选地址集合。应用场景在于当种子分布不均衡、存在大片未覆盖区域时,6Forest能发掘种子稀疏区域中的高活跃子空间。实验表明,6Forest相比传统单树算法(6Tree、6Scan等),在不平衡数据集上探测到的活跃地址数量高出数倍,同时还能发现许多新前缀下的活跃地址。论文报告在5个均衡和4个不均衡种子数据集上,6Forest均取得了最高的命中率和覆盖率。值得一提的是,6Forest在划分时融合了一种孤立森林(Isolation Forest)方法来剔除种子中的异常值(离群地址)。这意味着算法会忽略那些与多数种子模式差异很大的地址,防止它们干扰划分过程。这一机制不仅提升了划分的合理性,也可以视作一种恶意地址识别手段:若某些种子属于反常地址模式(可能来源于恶意配置),将被识别为离群点而淡化影响,从而优先扫描更常规的地址区域。

机器学习与深度学习算法

随着机器学习的发展,研究者开始引入监督学习、生成模型和强化学习来解决IPv6地址生成问题。这些方法期望自动学习IPv6地址的分配模式,包括前缀分配策略和接口ID惯例,甚至能跳出种子前缀范围去预测新的活跃地址段。输入通常也是种子地址(有的需要较大规模种子进行模型训练),以及可能的辅助特征(如地址的文本表示、网络分配信息等)。输出为模型生成的地址集合,往往可以产生不局限于原始种子的全新前缀地址。应用场景除了hitlist扩充外,还包括提升扫描的多样性、防止陷入种子局部最优,以及在极少种子甚至无种子的情况下探索IPv6空间。性能指标方面,这类算法关注命中率、生成的新前缀比例、多样性指标,以及模型训练和推理的时间/资源开销等。

基于强化学习的算法 (6Hit、AddrMiner、6Sense等)

6Hit由周桐庆等人在INFOCOM 2021提出,是首个将强化学习引入IPv6地址生成的算法。6Hit将扫描过程建模为一个agent在IPv6地址空间中移动、获取奖励的过程:输入为初始少量种子地址,算法以6Tree生成的地址空间树为基础,将每次探测命中视为奖励,不断学习哪类区域奖励高。具体而言,6Hit在扫描中根据反馈动态调整搜索方向:对高命中率的区域增加探索,而对一段时间内回报递减的区域则停止深入并可能重建空间树以避免局部陷阱。这种在线决策使6Hit相对初始种子鲁棒:即使种子很少也能逐步扩展到更广区域。输出为扫描过程中发现的活跃地址列表。应用上,6Hit适合在扫描预算有限时最大化发现量,已被用于互联网地址测绘和安全扫描等研究。实验表明6Hit在真实网络中取得了最高命中率,相同探测包预算下找到的活跃地址数明显多于当时其他方法。例如,作者报告6Hit比6Gen等方法命中率提高近一倍以上。需要注意6Hit的局限:由于未针对别名前缀做特殊处理,它在学习过程中可能因为别名区域的高回报而过度聚焦这些区域,造成实际效率下降。后续一些工作通过引入别名检测缓解了此问题。

AddrMiner是清华大学团队在USENIX ATC 2022提出的一个综合强化学习扫描系统。AddrMiner将全球IPv6地址探测划分为三种场景:无种子的区域种子很少的区域种子充足的区域。在完全无种子的网络段,AddrMiner先通过启发式方式尝试常见地址(如各前缀的::1、DNS解析收集等)来获取初始种子;对于种子稀少的区域,采用强化学习逐步扩展,根据探测反馈不断修正对区域密度的估计,避免因初始采样偏差错过重要区域;对于已有较多种子的区域,则利用密度学习策略(类似于6Tree/6Hit)动态调整扫描方向。可以看出,AddrMiner本身并非单一算法,而是综合运用了启发式 + 强化学习的混合策略,针对不同数据充足程度采用不同模块,最终输出整个互联网范围内的活跃地址列表。AddrMiner的目标是构建快速、高覆盖率的全球IPv6活跃地址发现系统。据报道,其探测效率和覆盖度相比先前方案有显著提升。例如,在真实测试中,AddrMiner在几天内就积累了数千万级别的活跃地址,覆盖了大量以前未被发现的前缀。AddrMiner的出现表明,通过多阶段多策略融合,即便起始信息不足,也可以逐步拓展IPv6地址空间的可见度。

6Sense是由美国佐治亚理工学院等在USENIX Security 2024发表的系统。6Sense采用深度强化学习生成候选地址,并辅以对IPv6地址结构和分配策略的内置知识。输入为一组已知的活跃地址种子,6Sense首先利用领域知识将IPv6地址拆分为**“分配前缀+子网ID+接口ID”三部分,并针对不同部分设计了适用的行动空间(例如针对前缀部分的Allocation-aware策略,针对接口ID部分的End-host behavior策略)。然后,算法通过强化学习智能体在这三个子空间中选择生成地址片段并组合,输出多样化的完整IPv6地址候选集。在实际扫描阶段,6Sense能够找到比先前方法多3.6倍的活跃主机和更多的新/64前缀。应用场景方面,6Sense不仅用于一般地址发现,还特别侧重安全分析**:研究团队利用6Sense扫描结果进行了IPv6上的TLS证书收集、敏感服务探测、开放端口扫描等安全测量,发现了超过8.1万台暴露在公网、存在安全风险的设备。这些包括虚拟化管理接口、企业网络设备、消费级路由等,并进一步关联揭示了至少70个相关CVE漏洞。6Sense的实际部署性能证明了生成算法在安全领域的价值:通过高质量地址候选集,显著拓展了安全扫描的覆盖面。作者已将6Sense开源(GitHub项目名称:IPv6-Security/6Sense),为后续研究提供了一个可扩展的平台。

深度生成模型算法 (6GCVAE、6VecLM、6GAN、6Diffusion等)

随着深度学习在生成任务上的成功,研究者也探索了将IPv6地址看作**“语言序列”来训练生成模型。此类方法一般将128比特地址映射为一定长度的词序列,然后应用神经网络学习生成类似序列的能力。输入仍是种子地址集,但通常需要较大量的训练数据。输出则是经过神经网络生成的新地址,往往能够突破原始种子的范围,具有一定创新性。应用场景为离线生成高质量候选地址集,再供扫描验证,可显著提高候选集的多样性和新前缀覆盖。需要平衡的是训练成本泛化效果**:过小的模型难以学习IPv6复杂模式,过大的模型则训练耗时、可能生成无效地址或陷入某些模式。以下介绍几种代表性模型:

6GCVAE:Cui等人在2020年提出的门控卷积变分自编码器模型。6GCVAE是首个深度学习IPv6生成尝试。它将IPv6地址向量输入一个堆叠的卷积编码器提取语义特征,并通过VAE的解码器生成新地址。门控卷积有助于捕捉地址段的局部模式。输入为大规模种子地址用于训练,输出为VAE生成的候选地址集。6GCVAE证明了深度学习可用于IPv6地址分布建模,但效果上存在生成无效地址(如未分配前缀)和偏向别名区域的问题。这是因为模型可能在训练数据中学到了不代表真实分配的模式或受到噪声干扰。后续工作尝试在数据预处理和模型结构上改进这一点。

6VecLM 与 6Former:这是Cui等人2020-2021年的系列工作,将词向量和语言模型引入IPv6地址生成。6VecLM首先提出将IPv6地址映射到语义向量空间:将每个nybble视作“词”,把整个地址视作“句子”,用Word2Vec方法训练地址的词向量表示。然后,利用Transformer架构训练“IPv6语言模型”,让模型学会依次预测地址序列中的下一部分。输出的新地址相当于“语言模型续写”的结果。6Former是之后的改进版本,关键差异在于将“词”的粒度加倍——用每两个半字节(即1字节)作为词单位。这样地址序列长度减半,有助于Transformer更高效地学习长程依赖。实验表明,与6VecLM相比,6Former生成地址的有效率有所提升,无效地址减少。然而,这两种模型仍存在趋向训练数据模式的问题,如可能主要产生属于已有前缀范围的地址,跨前缀泛化能力有限。此外,训练此类语言模型需要大量标注数据(种子地址),获取足够多样且代表性的训练集本身是挑战。

6GAN:Cui等人在2021-2022年又提出了6GAN算法,将生成对抗网络(GAN)与强化学习相结合,以改进深度生成效果。6GAN首先根据种子地址的特征将其聚类为k类模式,为每一类训练一个生成器网络,再使用一个多分类判别器来对抗训练这些生成器。与此同时,6GAN引入一个别名检测器,在生成阶段判定候选地址是否属于别名前缀并加以剔除。生成器还结合了强化学习奖励信号,指导其生成不同模式且非别名的地址。输出是多个模式下综合的地址列表。通过多生成器协同,6GAN实现了一算法多模式的生成,能产生不同风格的地址,增加了结果的多样性。论文报告6GAN显著提升了新前缀地址的发现率,避免了模型退化只输出单一模式的问题。不过,6GAN的不足在于模型复杂、训练难度大(需要调校GAN和RL的平衡),在性能开销上相对较高。

6Diffusion:这是北京邮电大学He等人在2024年提出的最新方法,采用扩散模型来生成IPv6地址。扩散模型近年在图像、文本生成上表现优异,被引入地址生成领域。6Diffusion将IPv6地址嵌入到连续向量空间中,执行前向随机噪声扩散过程将种子地址逐步扰动接近均匀分布,然后通过反向过程逐步去噪还原,生成与原种子分布相似但不完全相同的新地址。模型使用了改进的DDIM采样以加速生成,并设计了全局-局部融合多头注意力机制(GLF-MSA)捕捉IPv6地址分层分配的全局结构地址片段的局部特征。这样能更准确地拟合活跃地址的复杂分布。6Diffusion的输入为标准化处理后的种子地址集,输出为模型生成的大量候选地址。实验结果显示6Diffusion在命中率新前缀发现率等多项指标上均超越之前的最佳方法。例如,论文称其候选集平均命中率达到46.73%,生成的新活跃前缀数量明显增加。6Diffusion证明了生成式AI在IPv6测绘中的潜力。不过需要注意,其深度模型训练和推理需要较高的计算资源(GPU),在实际部署时需权衡效率。此外,任何基于学习的方法都可能受到训练数据偏差影响,需要定期用最新的地址数据重新训练以跟上IPv6部署变化。

算法对比分析表

下表汇总了主要IPv6地址生成算法的特点,对比它们的类型、所需数据、复杂度、可扩展性、实际性能和适用性等:

算法名称 类型 数据依赖 算法复杂度与训练成本 可扩展性 实际部署性能 时间与地区适用性
Entropy/IP (2016) 基于统计(概率模型) 大量真实种子用于建模 训练使用贝叶斯网络,复杂度中等;无需GPU 中等:模型大小随段数增长 一次性离线生成,发现率一般;
需较多种子支撑模型准确
偏好传统稳定分配(如EUI-64);
对后期随机地址分配适应性差
6Gen (2017) 启发式(聚类) 依赖种子集,无需额外数据 AHC聚类开销随种子量平方级增长;无训练过程 高:可并行处理不同簇 离线生成55M地址,命中率显著提升;
对别名前缀未特别处理
种子时代特定(2017年);
在地址规划变化后需新种子重新运行
6Tree (2019) 启发式(划分树) 依赖种子集,需基础前缀信息 DHC划分单次O(N)但多次迭代;在线扫描无模型训练 高:可分布式扫描子树 动态扫描发现数百万地址;
引入别名检测减少浪费
适应当时别名问题;
需要根据当前地址分布调整划分策略
6Scan (2023) 混合(划分+反馈) 种子集+扫描反馈(异步通信) 实时编码解码开销小;异步架构高效;无模型训练 很高:异步架构,支持超大规模扫描 全球扫描效率大增,区域命中统计提升命中率;
TON论文报告性能领先
针对全球扫描设计,
可按地区前缀编码调整(支持国家/AS划分);
需持续更新以适应新别名
HMap6 (2023) 启发式(BHC混合聚类) 种子集 双向聚类复杂度适中;实现为C++本地代码 高:聚类可并行,实现优化时间复杂度 集成于6Scan,实际扫描中提高了新地址发现量;
时间开销较低
结合多种策略适应广域网络;
地区间差异通过国家/AS前缀输入可调整
DET (2022) 混合(熵+划分迭代) 种子集+扫描反馈 每轮构建树O(N),多轮迭代累积开销大;无深度模型 中等:多轮过程可并行但有同步点 模拟显示命中率提升,但实际部署未见广泛报告;
受别名干扰可能降低效率
针对地址分布稳定期设计;
需根据当时时间的地址熵特征调参
6Hit (2021) 学习(强化学习) 少量种子+扫描实时奖励反馈 RL智能体每步计算开销低;无深度网络,训练即扫描过程 高:可分布式部署多个agent扫描 实测命中率最高,可快速扩展少量种子;
对别名无处理易陷入局部
自动适应地区差异(基于反馈);
随时间变化通过持续学习自适应
AddrMiner (2022) 混合(启发+RL系统) 无/少/多种子皆可,自适应 多模块协同,设计复杂但各子模块可并行;需要一定算力支撑 高:分场景并行探测,扩展全网 USENIX实证覆盖全网前缀,新增大量地址;
探测效率高于同类方法
针对2022年全球IPv6部署;
可随地址变动调整各子模块策略
6Sense (2024) 学习(强化+知识融合) 中等规模种子+IPv6分配知识 深度RL需GPU训练策略网络;引入结构特征降低训练难度 较高:可在多线程环境生成地址 实测发现主机数较前提高3.6倍;
发现8万+安全风险设备
考虑区域分配策略,适用不同地区IPv6规划;
需根据新威胁场景更新训练
6GCVAE (2020) 学习(深度VAE) 大量种子作训练集 模型参数中等,GPU训练耗时;推理快速并行 中等:一次训练适用相似数据分布 生成地址覆盖原种子前缀,部分无效地址问题;
验证命中率一般
基于早期数据训练;
对后期地址随机化适应不佳,需新数据再训练
6VecLM (2020) 学习(词嵌入+Transformer) 海量种子训练Word2Vec+LM 训练耗时长(语料=地址集规模大),需GPU;推理较快 中等:模型泛化受训练语料限制 生成地址多属已知模式,新颖度有限;
生成部分无效或别名地址
依赖训练时地区数据特征;
地址规划变化需重新训练embedding
6GAN (2022) 混合(GAN+RL) 大量种子+别名标注(可选) 多生成器+判别器+RL,训练极复杂,需强算力 较低:模型复杂度高,不易扩展 提高新前缀发现率,减少别名干扰;
但耗时长,尚无实时部署报道
理论上适用各地区(模型学泛化);
实践需大量新数据持续训练
6Diffusion (2024) 学习(扩散模型) 大量种子,需规范化预处理 训练开销巨大(扩散多步迭代,需GPU),生成较慢 中等:可通过并行采样提高效率 在多指标上性能最优;
命中率达46.7%,新前缀覆盖提升显著
适应最新全球地址分布;
模型需频繁用新数据微调以保持准确

表:主要IPv6地址生成算法比较。类型“基于启发”指规则挖掘或聚类算法;“基于学习”含传统ML、深度学习和强化学习;“混合”指融合多策略或多阶段的方法。实际性能根据论文报道,时间与地区适用性为作者根据算法原理的分析。

相关论文与开源资源汇总

为了便于读者进一步阅读研究细节,下表按算法汇总了已发表论文来源(DOI/PDF)及其对应的开源实现(若有):

  • Entropy/IP“Entropy/IP: Uncovering Structure in IPv6 Addresses”, IMC 2016(Foremski等); 无官方代码公开。
  • 6Gen“Target Generation for Internet-Wide IPv6 Scanning”, IMC 2017(Murdock等); Python实现6Gen由社区提供(非官方)。
  • 6Tree“6Tree: Efficient Dynamic Discovery of Active Addresses in the IPv6 Address Space”, Computer Networks 2019(Liu等); 6Tree代码在作者主页提供。
  • 6Hit“6Hit: A Reinforcement Learning-based Approach to Target Generation for IPv6 Scanning”, IEEE INFOCOM 2021(Hou等); 6Hit开源实现由作者提供在GitHub。
  • 6Scan“6Scan: A High-Efficiency Dynamic Internet-wide IPv6 Scanner with Regional Encoding”, IEEE/ACM TON 2023(Hou等); 6Scan工具已开源,包括HMap6等模块。
  • HMap6“Search in the Expanse: Towards Active and Global IPv6 Hitlists”, IEEE INFOCOM 2023(Hou等); 集成在6Scan项目中(HMap-tga6模块)。
  • DET“Enabling Efficient Probing of IPv6 Active Addresses (DET)”, IEEE ICNP 2022(Song等); 暂未发现公开代码。
  • AddrMiner“AddrMiner: A Comprehensive Global Active IPv6 Address Discovery System”, USENIX ATC 2022(Zhu等); AddrMiner v2.0代码已在GitHub发布。
  • 6Sense“6Sense: Internet-Wide IPv6 Scanning and its Security Applications”, USENIX Security 2024(Werst等); 6Sense代码已开源 。
  • 6GCVAE“6GCVAE: Gated Convolutional VAE for IPv6 Target Generation”, presented at CNCF 2020(Cui等); 相关代码可能包含于6VecLM项目。
  • 6VecLM“6VecLM: Language Modeling in Vector Space for IPv6 Target Generation”, ECML-PKDD 2020(Cui等); 6VecLM代码在GitHub提供 。
  • 6GAN“6GAN: IPv6 Multi-Pattern Target Generation via Generative Adversarial Nets with RL”, IEEE ICDCS 2022(Cui等); 6GAN代码已在GitHub开源 。
  • 6Diffusion预印本:“6Diffusion: IPv6 Target Generation Using a Diffusion Model...”, arXiv 2024(He等); 论文提供了方法细节,目前无公开代码(可能在论文附录)。

以上资源和引用涵盖了截至2025年中的主要研究进展。总体来看,IPv6地址生成算法从早期规则和统计方法,发展到融合机器学习和强化学习的多样化手段,不断提高扫描的效率和覆盖。今后,随着IPv6部署模式演进以及攻击者策略变化,如何设计更智能、更自适应的地址生成算法(例如结合实时流量分析、联邦学习等)将是一个值得关注的方向。希望本综述能够为相关研究提供有价值的参考。

About

No description, website, or topics provided.

Resources

Stars

2 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors