加载中...
共找到 65 个相关工具,可按分类继续缩小范围
百度文库内置的 AI 写作与阅读助手,支持文档总结、一键生成 PPT、论文降重、写作润色等功能,与百度文库海量文档资源打通。适合学生与职场人做文档、写论文、做汇报 PPT,国内访问速度快,免费版提供基础能力。
一种高保真、多样化的文本生成 3D 方法,发表于 NeurIPS 2023,主要面向研究与算法验证场景,可作为理解文生 3D 技术路线的参考。仓库提供论文与复现说明,适合有 3D 生成研究需求的开发者。需要注意的是,这类方法对算力与显存要求较高,实际复现成本不低,落地前建议先评估硬件条件与预期投入。
LGM(Large Multi-View Gaussian Model)是发表于 ECCV 2024 的 3D 内容生成方案,思路是用大规模多视图高斯表示,在较短时间内把文本或图像提示转成可渲染的 3D 资产。项目开放了论文与代码,主要面向研究与算法验证场景,也可作为理解高斯泼溅路线在 3D 生成中应用的参考。需要注意的是,这类研究型方案对显存与训练环境要求较高,复现成本不低,落地前建议先确认硬件条件与预期产出精度。
InstantMesh 是一个单图生成 3D 网格的开源方案,思路是从一张图片出发快速重建出带贴图的 3D 模型,输出网格可直接导入常见建模与实时渲染流程。项目由腾讯 ARC 实验室开源,提供论文与代码,主要面向研究与算法验证场景,也适合需要快速做 3D 原型的技术人员参考实现细节。需要注意的是,单图重建对原图视角与遮挡情况较敏感,生成模型在薄结构与背面细节上通常需要人工修补,正式使用前建议先做小样本验证。
Wonder3D 是一个单图生成 3D 的开源方案,通过跨域扩散模型在生成多视图图像的同时产出对应法线信息,再据此重建出带纹理的 3D 网格,思路对理解图生 3D 的一致性保持有参考价值。项目提供论文与代码,主要面向研究与算法验证场景。需要注意的是,单图重建对输入图片的视角与遮挡情况敏感,生成模型在复杂结构上需要人工修补,实际使用前建议先用多组图片测试重建质量。
threestudio 是一个统一的 3D 内容生成研究框架,把基于分数蒸馏(SDS)等路线的多种方法整合到同一套训练与推理代码中,便于研究者对比不同算法、快速复现论文实验。适合做 3D 生成方向研究、需要统一实验环境的开发者。项目开源并持续更新。需要注意的是,该框架面向研究用途,依赖较重且训练对显存要求较高,从研究代码到稳定服务还有较大的工程化距离,落地前建议评估硬件与维护成本。
面向结构化 3D 生成的学术开源项目,采用按部件分解的思路,从图像生成带独立结构的 3D 网格,便于后续对单个部件做编辑、替换与装配。论文发表于 NeurIPS 2025,代码与权重已在项目主页开放,适合研究者与建模人员学习其生成流程并做二次实验。需要注意的是,此类研究项目的工程完整度通常有限,输出网格在拓扑质量与细节上可能仍需修复,正式用于生产前建议先在目标引擎中测试导入与渲染效果。
从单张图片重建 3D 网格的学术开源项目,可生成带贴图的物体模型,生成速度相对较快,适合为资产库快速补充原型模型或做概念验证。论文发表于 NeurIPS 2024,代码与权重已开放,适合研究者与建模人员学习与二次开发。需要注意的是,单图输入能提供的信息有限,模型对遮挡区域与背面细节主要依靠推断,复杂结构或细长部件容易出现形变,正式用于项目前建议先检查网格质量并按需精修。
由研究团队开源的大规模 3D 生成模型,采用结构化潜空间表示来统一处理不同输出格式,可从单张图片生成带材质的三维资产,在几何与外观一致性上做了针对性设计。论文发表于 CVPR,代码与模型权重已开放,适合研究者与 3D 内容创作者试用其生成流程。需要注意的是,生成资产的网格密度与拓扑通常不适合直接用于影视级生产,导入引擎前建议做减面与修复,显存占用也需按本机配置评估。
从单张图片生成三维物体的开源项目,采用分层式思路先构建几何再补充纹理,输出带贴图的 3D 网格,在细节表现上做了针对性优化。论文发表于 ICLR,代码已开放,适合研究者与建模人员参考其生成流程并做二次实验。需要注意的是,此类研究项目在运行环境与依赖版本上较为敏感,复现可能需要一定工程投入;生成网格的拓扑与面数不一定适合直接进生产管线,导入引擎前建议做修复与减面。
面向生命科学场景的 AI 助手,可围绕基因、蛋白质与生物医学文献进行问答和资料梳理,帮助研究者快速了解相关背景与术语含义,适合做文献调研与知识整理的辅助工具。需要注意的是,生成内容可能存在事实偏差或引用不准确,不能作为实验设计与临床决策的依据;涉及具体序列、结构与文献结论时,务必回到原始数据库与论文核对,并结合领域内的专业判断使用。
轻量级生成对抗网络的 PyTorch 实现,面向小数据集与有限算力场景,用较少的参数量训练图像生成模型,适合作为论文复现与生成模型入门的学习材料,代码开源在 GitHub。需要注意的是,该仓库为研究性质的实现,训练结果受数据规模与超参数影响较大;生成图像的分辨率与细节有限,直接用于商业素材前需要评估质量与版权风险。
表格数据注意力网络的 PyTorch 实现,使用 Transformer 结构处理结构化表格特征,论文提出用于提升类别特征的表示能力。适合研究表格建模方法、并希望在自有数据上做对比实验的开发者。需要注意的是,该仓库为论文实现的代码,未包含完整的数据处理与调参流程,套用到业务数据前需要自行做缺失值处理与特征工程,并与其他树模型基线对比。
Meta 研究团队开源的轻量级游戏研究平台,面向强化学习与游戏 AI 的实验需求,强调端到端的训练流程与可复现性,便于研究者搭建自定义游戏环境并开展算法对比。适合做强化学习实验与复现论文的团队。需要注意的是,该仓库年代较早,依赖环境与当前的深度学习框架版本可能存在兼容问题,复现前建议先确认依赖;社区的维护活跃度也需要评估,投入前宜先评估其维护状态。
面向医学图像分割的扩散模型开源实现,在分割任务中引入扩散过程来提升边界区域的精度,可处理多种模态的医学影像,论文与代码已开放,附有训练与推理流程说明。适合医学影像分析方向的研究者与算法工程师参考其思路并做对比实验。需要注意的是,医学场景对结果的可靠性要求极高,模型输出不能作为临床诊断依据,实际落地需在合规框架下完成数据脱敏、效果评估与医生复核;公开数据集的标注质量也会直接影响结果。
DeepMind Flamingo 视觉语言模型的 PyTorch 实现,论文提出用少量示例即可完成图像问答与描述任务,仓库提供了模型结构、训练要点与使用示例,便于研究者理解其跨模态对齐的设计思路。适合做视觉语言模型实验的开发者。需要注意的是,该仓库为论文实现的复现版本,未包含原论文的完整训练数据与流程,复现结果存在差距;训练此类模型对显存与数据规模要求较高,个人环境建议从推理与小规模微调入手。
一个整理区块链与人工智能交叉领域资料的开源清单,汇总两个方向结合的应用案例、论文与研究项目,涵盖链上数据分析、去中心化算力与模型激励等方向,便于了解该交叉领域的研究现状。适合技术选型调研与课题方向探索。需要注意的是,该领域项目更新快、落地案例有限,清单中的部分条目已停止维护;涉及加密资产的应用需要格外注意合规与资金风险,不应将清单内容视为投资依据。
图像编辑的研究项目,通过在生成过程中拖拽图上的控制点来调整物体形状、姿态与位置,同时保持其他区域基本不变,可实现笑眼、转头等精确编辑,论文发表于 SIGGRAPH,官方代码与在线演示已开放。适合研究生成模型可控编辑的开发者参考。需要注意的是,官方实现发布较早,依赖环境与当前主流框架版本存在差异,复现需要一定的工程调整;复杂形变下仍可能出现背景畸变,实际修图建议结合其他工具做局部修补。
一个汇总人工智能、机器学习、深度学习与计算机视觉学习资源的开源清单,按主题整理了课程、书籍、论文与公开数据集,并提供学习路径建议,便于读者按阶段推进并对照检查知识盲区。适合刚进入该领域、需要建立整体框架的人。需要注意的是,清单以链接聚合为主,部分资源年代较早或已失效,建议优先选择有持续维护的课程与教材;关键概念仍应以原始论文或官方文档为准,避免仅凭清单描述下结论。
一个整理人工智能安全与攻击技术资料的开源合集,汇总对抗样本、模型窃取、提示词注入等方向的论文、工具与公开案例,便于研究者了解攻击面与防御思路。适合从事模型安全评估与红队测试的技术人员参考。需要注意的是,其中涉及的攻击方法具有潜在破坏性,仅应在获得授权的环境中用于安全测试,不得用于攻击他人系统或规避服务商的安全机制;对外分享研究结果时也应遵循负责任披露原则。
DeepMind 提出的通用强化学习算法实现,用同一套超参数在世界模型上训练,即可在多个不同领域的任务中达到较好表现,论文与实现细节已公开,便于研究者理解其统一训练思路。适合做强化学习与决策智能研究的团队。需要注意的是,训练完整版本需要大量算力与并行环境支持,个人环境通常只能做小规模实验;不同任务上的效果仍存在差异,复现结果受环境配置与随机种子影响较大。
一个整理人工智能在金融领域应用资料的公开仓库,汇总相关论文、公开数据集与书籍,覆盖量化研究、风险建模与文本分析等方向,便于了解该交叉领域的研究脉络。适合做金融科技方向调研的开发者与研究人员。需要注意的是,仓库以资料索引为主,其中的策略示例多用于学术讨论,不构成任何投资建议;金融数据涉及合规与授权,实盘应用前应充分理解风险控制要求,并在受控环境中长期验证。
DALL-E 文生图模型的 PyTorch 实现,把论文中的离散变分自编码器与大语言模型结合的两阶段思路落到实处,提供训练脚本与可调用的生成接口,便于研究者理解文本与图像的对齐方式并做二次实验。适合希望深入生成模型内部结构的开发者与研究者。需要注意的是,该实现与原论文的规模存在差距,复现效果受数据量与算力限制;训练此类模型对显存要求较高,个人环境建议先在缩小配置下跑通流程再评估。
微软推出的面向初学者的 AI 入门课程,用十二周、二十四节课的结构讲解人工智能基础、神经网络、计算机视觉与自然语言处理等主题,每课配有讲解、测验与动手实验,并提供多语言翻译版本。适合零基础或需要系统补齐基础概念的学习者与教师参考。需要注意的是,课程偏重概念与入门实践,深度有限,进阶方向仍需要结合论文与专项课程;实验依赖的库版本会随环境变化,本地运行可能需要按当前版本做适配。
一个面向通用任务自动化的多智能体框架,通过让智能体分工协作并使用浏览器、代码执行与文档处理等工具,完成信息检索、数据整理与内容生成等跨步骤任务,代码与论文已开放。适合研究多智能体协作与工具调用机制的技术人员。需要注意的是,多智能体流程的稳定性与成本较难控制,任务链条变长后容易出现错误累积;涉及联网抓取与文件操作时应注意权限边界,用于生产前建议限定操作范围并保留人工确认环节。
Google Imagen 文生图模型的 PyTorch 实现,采用级联扩散结构与文本编码器的组合思路,仓库提供了模型结构的复现、训练要点与生成示例,便于研究者理解文本到图像生成的关键设计。适合做生成模型实验的开发者与研究者。需要注意的是,该仓库为论文实现的复现版本,未包含原论文的完整训练数据与算力条件,生成效果与原模型存在差距;训练对显存要求较高,个人环境建议先从小规模配置与推理示例入手。
AlphaFold 2 的非官方 PyTorch 实现,复现了从氨基酸序列预测蛋白质三维结构的关键模块与训练流程,仓库包含模型定义、注意力模块与使用示例,便于研究者理解其结构预测的实现思路。适合做蛋白质结构预测与生物信息学方向的研究者。需要注意的是,非官方复现与原论文在数据、训练规模与精度上存在差距,结果不能直接用于科研结论;完整训练需要极高的算力与专业的生物数据准备,一般建议从推理与模块学习入手。
一种基于扩散世界模型的强化学习智能体,让智能体在学到的环境模型中想象未来状态并据此决策,在部分基准任务上取得了较好表现,论文与代码已公开并附有可视化结果。适合做强化学习与决策智能研究的人员。需要注意的是,训练需要大量环境交互数据与算力支持,复现门槛较高;世界模型的精度会直接影响策略质量,在真实环境中部署前需要重新评估适用性。
AudioLM 音频生成模型的 PyTorch 实现,采用分层建模思路把音频的语义表示与声学细节分开处理,从而生成长度较长且连贯的音频片段,仓库提供模型结构与训练示例,便于研究者理解音频语言模型的实现方式。适合做音频生成与语音处理研究的开发者。需要注意的是,该仓库为论文实现的复现版本,训练需要大量的音频数据与算力支持;生成音频的质量与时长受训练规模限制,商用前还应确认训练数据与模型的授权范围。
一个研究性质的软件开发自动化方案,通过让模型分阶段定位问题、生成候选补丁并做筛选验证,在不引入多智能体协作的情况下完成缺陷修复任务,论文与实现代码已公开并附有评测结果。适合研究自动化程序修复的开发者参考。需要注意的是,该方案的效果依赖缺陷的可定位性与测试用例的完备程度,在复杂项目中仍有明显局限;生成的补丁必须经过完整回归测试,且需要在受控环境中执行,避免影响真实仓库。
MusicLM 音乐生成模型的 PyTorch 实现,采用分层结构把文本描述逐级映射为语义标记与声学细节,从而生成与文字描述相符的音乐片段,仓库提供模型定义与训练示例,便于研究者理解音乐生成的技术路径。适合做音频生成方向研究的开发者。需要注意的是,该实现为论文复现版本,训练需要大量音乐数据与算力支持,个人环境通常只能做推理与小规模实验;生成音乐的版权归属与训练数据授权范围需要事先确认,商用前建议咨询专业人士。
【Zotero AI 管家】调用大模型,自动精读论文库里的论文,总结为Zotero笔记。支持主流大模型平台!您只需像往常一样把文献丢进 Zotero, 管家会自动帮您精读论文,将文章揉碎了总结为笔记,让您“十分钟完全了解”这篇论文!
阿里通义实验室开源的研究项目,围绕文档理解与文字识别方向,提供多种预训练模型与训练代码,覆盖版面分析、表格识别与文本检测等任务,并公开论文与实验配置,便于研究者复现与做对比实验。适合从事文档智能与 OCR 方向研究的开发者。需要注意的是,模型训练需要较大的数据量与算力支持,个人环境通常只能做推理与微调;不同文档类型上的效果差异明显,落地前建议用自有语料做小规模验证。
一篇围绕语言智能体设计的综述性论文,梳理了以语言模型为核心的智能体在规划、记忆与工具使用等方面的研究进展,并提出用认知架构的视角理解其能力边界,同时汇总了大量相关文献与代表性系统。适合研究智能体方向的开发者与学者作为综述参考。需要注意的是,该论文发表于智能体研究快速演进的阶段,其中部分系统与结论可能已被后续工作更新,阅读时应结合更新的文献交叉确认;论文提出的架构是分析框架而非可直接落地的实现方案。
一个围绕检索增强生成方向整理的社区资源集合,汇总主流框架、开源项目、论文与实践教程,并按用途分类,便于开发者了解技术路线与选型参考。适合正在搭建知识库问答系统的团队与技术爱好者。需要注意的是,该集合以索引与推荐为主,不提供统一的技术方案,条目质量与维护状态参差;检索增强的效果高度依赖数据切分与提示词设置,实际落地仍需要结合自有语料做专门调优与效果评估。
一个较早提出的多智能体协作框架,通过让两个角色在既定规则下对话与分工,研究智能体之间如何协同完成复杂任务,并探讨规模化智能体在能力与行为上的变化规律,论文与代码已开放。适合研究多智能体交互与角色分工的开发者与学者。需要注意的是,角色设定与任务拆解方式对结果影响很大,框架本身不提供通用的可靠性保证,复杂任务中仍可能出现偏离目标的情况;生产使用前应限定操作范围并保留人工确认环节。
一个整理机器学习与深度学习常用知识速查表的站点,把损失函数、优化器、评估指标与常见网络结构等要点做成便于检索的对照表,帮助研究者在写作、汇报或复习时快速确认公式与概念,也便于教学时作为参考资料。适合该方向的学生与从业者作为辅助工具。需要注意的是,速查表以要点归纳为主,缺少推导与适用条件说明,直接套用可能忽略前提假设;关键公式与结论建议回到教材或原始论文确认,避免在严谨场合引用出现偏差。
DALL-E 2 文生图模型的 PyTorch 实现,复现了以文本编码器与扩散解码器组合生成图像的关键结构,仓库提供模型定义、训练脚本与推理示例,便于研究者理解文本引导生成的技术路径并做二次实验。适合做生成模型研究的开发者。需要注意的是,该实现为论文复现版本,训练所需的数据与算力远超个人环境,生成质量与原模型存在差距,建议从推理与结构学习入手;涉及真人形象与版权素材的生成内容,对外使用前需要确认授权。
一份为机器学习从业者准备的可视化素材与模板集合,提供常用网络结构、流程与概念的示意图,并开放源文件便于修改颜色与标注,适合在论文、汇报与教学中快速产出规范配图。适合研究人员、学生与需要做技术讲解的人使用。需要注意的是,素材以英文标注为主,中文场景下需要自行替换文字并注意字体授权;使用时建议核对示意图与当前主流方法是否一致,涉及具体结构细节的配图仍应以原始论文为准,避免因转述产生偏差。
GigaGAN 图像生成模型的 PyTorch 实现,复现了以生成对抗网络结构实现高分辨率图像合成的设计思路,仓库提供模型结构、训练要点与使用示例,便于研究者了解对抗式生成方法的实现细节。适合做生成模型研究的开发者。需要注意的是,该实现为论文复现版本,训练此类模型需要大规模数据与充足算力,个人环境通常只能做结构复现与小规模实验;对抗训练本身对超参数敏感,训练不稳定与模式崩塌仍可能出现,评估生成质量时应结合多种指标。
一份整理人工智能学习资源的公开清单,按方向汇总课程、书籍、视频讲座与经典论文,覆盖机器学习基础、深度学习、自然语言处理与计算机视觉等主题,便于读者按兴趣挑选并建立知识体系。适合刚进入该领域的人作为索引使用。需要注意的是,清单以链接聚合为主,部分资源年代较早或已停止更新,建议优先选择有持续维护的课程与教材;阅读与观看之外仍应以动手实践为主线,关键结论建议回到原始论文确认。
一个面向人形机器人控制的强化学习框架,提供标准化的训练环境与配套的机器人模型,支持在仿真中训练行走与平衡策略并迁移到实体机器人,论文与实现已公开,便于研究者复现与做对比实验。适合做人形机器人运动控制研究的团队。需要注意的是,完整验证需要相应的硬件平台与安全防护措施,仿真与真实物理之间存在差距,迁移效果受模型精度与执行器特性影响;训练过程耗时较长,落地前应做好充分的实机安全评估与限位保护。
一种面向自动驾驶场景的三维占用预测方法的官方实现,通过相机图像推断场景中各体素是否被占据,从而支持对遮挡区域的感知与规划,论文发表于 CVPR,代码与训练配置已开放。适合做自动驾驶感知与三维重建研究的团队。需要注意的是,完整训练需要大规模驾驶数据集与多卡算力,个人环境通常只能做推理与模块学习;模型的预测精度受相机标定与数据质量影响较大,实车部署前还需针对具体传感器配置做适配与验证。
一个面向时空预测学习的开源基准库,汇集多种视频预测与气象预测模型,提供统一的数据加载、训练与评测流程,并给出各方法在标准数据集上的对比结果,便于研究者公平比较不同方案。适合做视频预测与时空建模研究的开发者。需要注意的是,完整跑通全部模型需要较大的算力与存储空间,实际使用建议先选定少数模型做实验;不同数据集上的表现差异明显,论文报告的结果与自有数据上的效果未必一致,迁移前需要重新训练与评估。
一份由机器之心整理的 AI 领域中英文术语对照资料,收录机器学习、深度学习、自然语言处理、计算机视觉等方向的常用专业词汇,给出英文原文、中文译名与简要释义,便于在阅读论文、撰写文档与翻译时统一用词。适合做技术翻译、论文写作与科普内容创作的从业者参考。需要注意的是,术语译名在业内并不完全统一,同一英文词在不同中文语境下可能有多种译法,正式发布前建议结合目标读者的习惯与主流期刊的用法再做判断;资料更新速度难以跟上领域演进,新兴术语可能未收录,建议交叉查阅原始论文与权威教材。
NaturalSpeech 2 语音合成模型的 PyTorch 实现,复现了基于潜在扩散的零样本语音与歌声合成思路,仅需少量参考音频即可模仿音色生成新的语音内容,仓库提供模型结构、训练脚本与推理示例,便于研究者了解扩散式语音生成的技术细节。适合语音合成方向的研究人员与开发者做结构复现与实验。需要注意的是,该实现需要规模较大的语音数据与较强的算力,个人环境通常只能做小规模实验或推理验证,合成效果的稳定性与原始论文存在差距;声音克隆涉及个人声音权益,用于对外发布或商业用途前必须取得声音权利人的明确授权,并注意避免用于伪造他人发言。
一个面向迁移学习与半监督学习的 PyTorch 工具箱,提供域泛化、域适应、跨域小样本学习与半监督等方向的统一实现与标准化流程,并内置多个公开数据集的加载与评测接口,便于研究者用一致的设置比较不同算法的效果。适合做迁移学习与域适应研究的算法工程师与研究生。需要注意的是,工具箱以复现论文方法为主,超参数与数据划分对其中的对比结论影响较大,迁移到自有数据时结果未必可复现;真实业务中的域差异往往比公开数据集更复杂,落地前应先在自有标注数据上做完整评估,并注意训练数据的采集与使用是否符合相关规定。
一种让语言智能体通过言语反馈自我改进的方法,智能体在完成任务后反思失败原因并把总结写入记忆,在后续尝试中参考这些经验调整策略,论文通过多轮试验验证了该机制在决策与编程类任务上的提升,代码与实验配置已公开。适合研究智能体自我改进与推理能力的研究人员参考。需要注意的是,反思结果的质量依赖基础模型的能力,错误的总结可能被反复强化,导致智能体在后续任务中走入误区;多轮试错会显著增加模型调用次数与费用,在真实业务中应设置明确的迭代上限与人工介入条件,避免无节制地消耗资源。
SoundStorm 音频生成模型的 PyTorch 实现,复现了以并行方式生成语音与音频码本序列的思路,配合语音分词模型可快速合成语音内容,仓库提供模型结构、训练脚本与推理示例,便于研究者了解并行音频生成相对自回归方式的效率优势。适合做语音合成与音频生成研究的开发者。需要注意的是,该实现为论文复现版本,完整训练需要较大规模的音频数据与算力,个人环境通常只能做推理与小规模实验;生成效果依赖前置分词模型的质量,合成语音用于对外发布或商业用途时,涉及参考音色的音频素材需要取得相应授权,避免声音权益纠纷。
一份面向自学者的开放文献清单与知识索引,围绕人工智能与机器学习主题,按难度与方向整理论文、教材、课程与博客等资源,并给出一条可循序推进的学习路径,便于脱离课程体系的学习者按自身节奏推进。适合希望系统补足理论基础的自学者与转行人员。需要注意的是,清单由个人维护,更新频率有限,部分链接可能失效或内容已过时,动手前建议先确认资源可访问;资源清单只能解决学什么的问题,掌握程度仍取决于练习与项目实践,建议及时把知识投入到可运行的小项目中,关键概念回到原始论文与权威教材交叉确认。
CCF Deadlines 汇总了中国计算机学会推荐会议列表中各学术会议的投稿截止日期,支持按研究方向筛选、倒计时提醒与订阅,帮助科研人员规划论文投稿时间,避免错过 deadline。网站免费使用,同时提供开源仓库,可自行部署并参与数据维护。
x-transformers 是 lucidrains 维护的 Transformer 完整实现集合,覆盖多种注意力变体与架构配置,代码结构清晰、便于阅读与改造,常被研究者作为新论文思路的实验基座。适合需要灵活定制注意力机制、或想深入理解 Transformer 内部实现的研究者与工程师。
UniRepLKNet 是发表于 CVPR 2024 并被 TPAMI 2025 扩展的视觉网络研究工作,把大卷积核思路扩展到多模态识别任务,在图像分类、检测等基准上给出了系统实验。仓库提供论文、预训练权重与复现代码,适合做视觉架构研究的团队参考,工程落地前建议在自有数据上验证。
ai_all_resources 是一个精选的 AI 资源列表仓库,按方向整理了模型、数据集、论文、教程与工具链接,持续更新,适合作为查找学习资料与选型线索的起点。内容以链接聚合为主,覆盖面广但粒度较粗,具体项目质量与维护状态仍需逐个确认。
RTDL 是 Yandex Research 开源的表格深度学习研究工具集,复现了多篇表格数据神经网络的论文并统一评测口径,配套数据处理与训练脚本。适合做表格建模研究、或对比树模型与深度模型优劣的团队参考,需要 PyTorch 环境,论文结论可直接对照复现。
LightMem 是发表于 ICLR 2026 的内存增强生成研究工作,通过轻量的记忆机制压缩对话与文档信息,在长上下文任务上降低 token 消耗并保持回答质量,仓库提供论文与实现代码。适合研究 LLM 长上下文管理与记忆机制的团队参考,可直接对照论文复现实验。
SincNet 是处理原始波形音频的神经网络架构,用可学习的带通滤波器组替代手工设计的梅尔特征,在说话人识别任务上兼顾效率与效果,论文与代码开源。适合做语音识别、声纹相关研究的开发者参考,使用需要一定的信号处理背景与 PyTorch 基础。
一个开源整理的音频 AI 时间线项目,按时间顺序梳理 2023 年以来语音合成、音乐生成等音频模型的发布脉络与论文链接,适合快速了解音频生成领域的发展轨迹与代表性工作。以资料聚合为主,可按时间轴对照论文与 Demo,作为选题调研的索引很方便。
一篇讲解神经网络架构图可视化方法的教程,介绍如何用代码把网络结构画成清晰的示意图,覆盖常用工具与写法,适合写论文、做技术分享时生成配图。内容以方法讲解为主,跟着操作即可复现,适合需要给模型结构做可视化说明的研究者与学生。
Meta-Transformer 是一篇统一多模态学习的研究工作,提出用同一套骨干网络处理文本、图像、点云、音频等多种模态,论文系统性验证了框架在不同任务上的效果。代码与论文开源,适合做多模态研究的团队参考,训练与推理需要较强的算力支持。
Graph Nets 是 DeepMind 发布的图网络研究论文与实现,提供了在 TensorFlow 中构建关系归纳网络的模块化框架,是图神经网络早期有影响力的开源工作。适合研究图学习的发展脉络与实现思路,项目已不活跃,生产环境建议改用 PyTorch Geometric 等。
北京团队开发的中英双语写作工具,核心能力是校对纠错与同义改写,支持文档级检查与批注式修改,可嵌入 Word/WPS 边写边改,多端内容同步。适合日常公文、论文与商业文案的打磨,基础功能免费,高级建议按会员提供,网页与客户端均可使用。
老牌英文改写工具,提供七种改写模式可调节语气与结构,长文段落整段重写比语法检查类工具更省事,另附语法检查与摘要能力,免费档单次最多处理 125 词。适合写英文邮件、论文润色与降重场景,深度使用建议订阅 Premium 解锁更长文本。
秘塔推出的中文写作校对工具,覆盖错别字、语法、标点与表述规范检查,提供改写、润色与翻译能力,学术模式下支持论文相关的表述建议,高校与科研场景使用较多。网页与浏览器插件形态,基础功能免费,深度功能按会员提供。
学术写作专用的 AI 助手,边写边给出句子建议与引用推荐,能按已有文献自动生成参考文献列表,支持面向查重的改写模式,写论文与文献综述的人群使用较多。按订阅付费,有免费试用额度,AI 建议的引用内容仍需逐条核实真实性。