跳转到主要内容

/简历

下载简历

Mohammad Raouf Abedini

人工智能安全研究 · 大语言模型代理红队测试 · 攻击性与防御性安全工程

澳大利亚悉尼 · 现可搬迁至加州 San Francisco · 可随时出差(Washington, DC) · 需要签证担保
01.

关于

安全研究员,致力于构建用于测量和遏制前沿人工智能网络能力的系统。Project Simurgh 的创建者——一个与提供方无关的遏制证明框架,在对抗性的、不诚实生产者威胁模型下对大语言模型代理进行红队测试,并生成经 Ed25519 签名、可离线验证的证据,记录代理在护栏失效后的行为:遏制了 138/138 个分类器漏检的案例,在 AgentDojo 上将实时代理的攻击成功率从 9/140 降至 0/140,五个经机器验证的 Lean 定理。在 Anthropic 的安全评估项目中(通过 Alignerr)评估了 Claude 输出的可利用代码与护栏绕过情况。定位为与内联分类器互补的纵深防御层:分类器管控模型可以说什么,而本框架则证明代理被允许做什么。端到端交付检测能力:设备端钓鱼检测机器学习模型达到 87% F1,实时入侵检测达到每秒 500K+ 数据包。一家孵化器支持的校园人工智能初创公司的联合创始人;已发布 70+ 个项目。

02.

安全研究

Node.js · Ed25519 证明 · Lean 4 · AgentDojo · Llama Guard 4 · Llama-3.3-70B · JS↔Python 一致性

Project Simurgh —— 面向代理型人工智能的可验证遏制证明(创建者 · AGPL-3.0)

  • 构建了一个与提供方无关的框架,生成经 Ed25519 签名、可离线复现的证据,记录人工智能代理在护栏失效后的行为,覆盖四个遏制边界:输入防火墙、上下文来源守卫、工具调用门控,以及输出泄露防火墙——均在对抗性的、不诚实生产者威胁模型下进行
  • 护栏失效遏制:在一个 180 案例的运行集上捕获了真实的 Llama Guard 4(12B)输入分类器,并遏制了该分类器漏检的 138/138 个恶意案例(其中 120 个是仅检查输入的分类器在结构上无法看到的下游注入案例,18 个是直接输入漏检);综合目标攻击成功率为 0/150,且零不安全工具执行或数据导出
  • 实时代理遏制:驱动一个自托管的 Llama-3.3-70B 通过 AgentDojo 的工作区套件(140 个预注册注入案例);工具权限门控将目标攻击成功率从 9/140 降至 0/140,同时保持了良性任务的可用性
  • 定位为与 Anthropic 内联分类器互补的纵深防御层——分类器管控模型可以说什么,而证明则管控代理被允许做什么(非主张部分经签名并明确说明,包括它本身无法捕获 2026 年 6 月的内容生成绕过)
  • 对自身的证明发起攻击(覆盖八类攻击的红队扫描 → detector-v2),并以五个经机器验证的 Lean 定理对监督机制进行形式化检验;以单条命令即可离线复现一个 12 级的签名发布阶梯;3,057 项自动化测试
03.

技术能力

> 编程语言

Python(主要)、C、C++、TypeScript、JavaScript、Swift、Kotlin、Bash、SQL、Go(熟悉)

> 安全与攻击性

漏洞研究、跨平台漏洞开发(Win32 API、macOS ScreenCaptureKit)、威胁建模、安全代码审查、渗透测试、负责任披露(OWASP/FIRST/CISA)、Wireshark、Nmap、Burp Suite

> 人工智能与机器学习

大语言模型(LLM)集成与评估、检索增强生成(RAG)评估、引用忠实度基准测试、人工智能辅助漏洞研究、自然语言处理(NLP)、生成式人工智能工具、机器学习模型评估、双重用途风险评估

> 系统与工具

Linux(Ubuntu/Kali)、CMake、Docker、Git/GitHub、GitHub Actions CI/CD、Google Test、FastAPI、Cloudflare Workers、libpcap

> 框架

OWASP Top 10、MITRE ATT&CK、NIST 框架、W3C Screen Capture 规范

04.

教育背景

网络安全学士

Macquarie University
May 2024 – Nov 2026
课程: 数字取证、网络安全、系统安全、云计算、自然语言处理(NLP)与机器学习、隐私保护数据分析

信息技术文凭

Macquarie University
Jul 2023 – May 2024
05.

精选研究与工程项目

C · Swift · Python · Win32 API · ScreenCaptureKit · WebRTC

IEEE 格式漏洞研究:独立发现并负责任地披露了一类跨平台屏幕捕获规避手法,利用操作系统级的显示关联 API(Windows/macOS)击败了基于浏览器的捕获以及人工智能视觉管线——在全部受测平台上实现 100% 规避,在超过 10,000 帧分析中零视觉伪影,并向操作系统厂商与监考厂商执行了协调一致的披露。DOI:10.5281/zenodo.20376495。

Aion [圣经 RAG]

2026

React Native · Expo · Supabase · pgvector · Gemini · OpenAI 嵌入 · Tauri v2

构建了人工智能驱动的圣经伴读应用,并撰写了 Aion-BibleQA——一篇 8 页预印本,提出了一个 40 题基准,用于评估引用忠实度与对错误前提的鲁棒性——R@5 = 0.941,平均引用支持度 = 0.978,零无依据引用,且对错误前提的拒答率为 6/6。DOI:10.5281/zenodo.20522874。

NanoMatch [系统]

2026

C++20 · CMake · Google Test

设计了高性能撮合引擎,以亚微秒级延迟处理每秒 100 万以上订单——实现了基于红黑树的价格档位、自定义内存池分配器,以及包含 p50/p99 延迟基准的完整测试套件。

SentinelFlow [IDS]

2026

C++17 · libpcap · CMake · Google Test · Linux

构建了实时网络数据包处理引擎,每秒解析 50 万以上数据包——支持协议解析(Ethernet/IPv4/TCP/UDP/ICMP/DNS)、基于特征的检测引擎,以及有状态分析(端口扫描、SYN 洪泛)。

Nexus Archive [全栈]

2025

Python/Litestar · React · PostgreSQL · Docker · Terraform

上线了一个全栈数据平台,配备人工智能推荐引擎、事件驱动的 API 设计、速率限制及自动化安全扫描——从数据库架构到部署基础设施的端到端负责。

Mehr Guard [KOTLINCONF]

2024

Kotlin Multiplatform · 本地机器学习 · Android 与 iOS

构建了具备本地机器学习分类能力的跨平台离线威胁检测工具——已提交至 KotlinConf 全球开发者大会。

GitHub 上另有 70 多个公开项目,涵盖漏洞研究、系统编程、人工智能/机器学习工具及云基础设施: github.com/Raoof128
06.

职业经历

自由职业安全工程师与全栈开发者

自雇 · 2024年1月 – 至今
  • 在 Supabase 上为生产级、多前端平台架构安全后端:WebAuthn 通行密钥、TOTP/短信多因素认证(MFA)、零信任边缘中间件、分布式速率限制、严格的 Postgres 行级安全(RLS),以及通过 SECURITY DEFINER RPC 实现的防篡改审计日志
  • 构建了包含 500 多项自动化安全测试的 CI/CD(GitHub Actions),将部署漏洞减少约 40%;为 1,000 名以上用户交付了以安全为先的应用,采用 OWASP Top 10 控制措施与 OAuth 2.0
  • 在 Airtasker 上,31 条客户评价与 35 项已完成任务中保持 5.0 星评分(95% 完成率,已通过身份验证),为付费客户提供 Web 开发、Python、API 集成以及 IT/安全工作

IT 经理

伊朗药房 · 2019年8月 – 2024年5月
  • 在一个多站点组织中管理技术基础设施长达 5 年——维持 99% 的系统正常运行时间,实施基于角色的访问控制(RBAC),并通过 Python/Bash 脚本自动化运营工作流(人工任务减少约 30%)
07.

人工智能安全、领导力与社区

  • 人工智能安全评估员,Claude(Alignerr,Anthropic 人工智能安全评估项目,2026 年):评估 Claude 输出的可利用代码,并分析安全护栏如何被绕过,提供结构化、基于评分标准的发现(延续先前 2024 年 Claude Code 评估工作)

Co-Founder · Macquarie Persian Students Society

2026 – Present
志愿服务 · Education

创立并协助运营大学的波斯学生社区——活动、同伴支持和文化项目。

08.

许可证与认证

> Anthropic (10)

AI Fluency for Students

颁发日期 Jul 2026 · 凭证 ID: acmpujtbn2xu

AI Fluency for Educators

颁发日期 Jul 2026 · 凭证 ID: 7x8msbzn49rt

Introduction to Model Context Protocol

颁发日期 Jul 2026 · 凭证 ID: yhi68u4mqt5x

Building with the Claude API

颁发日期 Jul 2026 · 凭证 ID: juoae2qtmggo

AI Fluency: Framework & Foundations

颁发日期 Jul 2026 · 凭证 ID: 645j7by2uo75

Claude Code in Action

颁发日期 Jul 2026 · 凭证 ID: 7kfqpyogooec

Introduction to Claude Cowork

颁发日期 Jul 2026 · 凭证 ID: bsqfvrbkpv2s

Claude Platform 101

颁发日期 Jul 2026 · 凭证 ID: q8dcrer7o2pa

Claude Code 101

颁发日期 Jul 2026 · 凭证 ID: oyf4ic48wnd5

Claude 101

颁发日期 Jul 2026 · 凭证 ID: hyagrxaidsbe

> Macquarie University (13)

Cyber Security: GRC Part 2 — Risk Management and Compliance

99.20%

颁发日期 Jun 2026 · 凭证 ID: JL4SAS9JOR8C

Cyber Security: GRC Part 1 — Governance

95%

颁发日期 Jun 2026 · 凭证 ID: 3G4JP3GKROWQ

Cyber Security: Mobile Security

99.28%

颁发日期 Jun 2026 · 凭证 ID: W7FRQ19BPTNM

Cyber Security: Applied Cryptography

98.56%

颁发日期 Jun 2026 · 凭证 ID: OVVCSLEB8ATT

Cyber Security: Data Security and Information Privacy

97.84%

颁发日期 Jun 2026 · 凭证 ID: K54QIRP9VVE9

Cyber Security: Digital Forensics

95%

颁发日期 Jun 2026 · 凭证 ID: YX5P82YME6FQ

Cyber Security: Identity Access Management and Authentication

100%

颁发日期 Jun 2026 · 凭证 ID: P1RJQUGSCM59

Cyber Security: DevSecOps

99.10%

颁发日期 Jun 2026 · 凭证 ID: GJEBDPIA0A6P

Cyber Security: Application of AI

99.20%

颁发日期 Jun 2026 · 凭证 ID: U2KSU5H0O0BV

Cyber Security: Security of AI

95.50%

颁发日期 May 2026 · 凭证 ID: DNZVZ3A7RVR1

Cyber Security: Essentials for Managers and Leaders

99.40%

颁发日期 May 2026 · 凭证 ID: LOBWM8KXGSZS

Cyber Security: Essentials for Workplace

92.80%

颁发日期 May 2026 · 凭证 ID: QT8ZBJIJ2HHO

Cyber Security: Essentials

96%

颁发日期 May 2026 · 凭证 ID: RNALWEYYSXO7

09.

补充信息

现可搬迁至 San Francisco;可立即入职(最后一个学期已在线完成)。需要签证担保。
英语(专业工作水平) · 波斯语/Farsi(母语) · 日语(初级)