Skip to main content

Command Palette

Search for a command to run...

ASCII smuggling: Kỷ nguyên AI và cuộc chiến chống Phishing

Updated
8 min readView as Markdown
ASCII smuggling: Kỷ nguyên AI và cuộc chiến chống Phishing

Tổng quan

Hiện nay các cuộc tấn công Phishing tinh vi (như phishing do LLM sinh ra, kết hợp kỹ thuật ẩn mã như ASCII Smuggling, Zero-width space hay Homoglyph) vượt qua được bộ lọc truyền thống vì bộ lọc truyền thống (Legacy SEG/Rule-based) chỉ dựa vào: Blacklist IP/Domain, Regex/Từ khóa tĩnh, Chữ ký file (Hash) hay SPF / DKIM / DMARC đang xảy ra phổ biến và bủng nổ hơn bao giờ hết. Ví dụ như kẻ tấn công chèn ký tự vô hình vào từ khóa (như "fun[U+E0020]ding"), chuỗi byte bị đứt gãy khiến bộ lọc literal bị mù hoàn toàn.

ASCII smuggling, kỹ thuật nổi tiếng trong prompt injection có thể ẩn dấu dưới mắt người dùng vì thế cần ứng dụng AI vào phòng thủ email, doanh nghiệp không thể chỉ trông cậy vào Secure Email Gateway (SEG) kiểu truyền thống đặt tại MX Record.

Cơ chế ẩn ký tự và vì sao nó qua mặt được bộ lọc

Dải Unicode Tags (U+E0000-U+E007F) vốn là bản sao ẩn của các ký tự ASCII in được, ví dụ U+E0041 tương ứng "A", U+E0061 tương ứng "a", ban đầu dùng cho gắn thẻ ngôn ngữ và nay gần như bị bỏ. Điểm mấu chốt là phần lớn các mã này không được font hay giao diện người dùng hiển thị ra. Trong chiến dịch này, một từ khoá như "funding" được gửi đi dưới dạng "fun" cộng một ký tự TAG SPACE ẩn cộng "ding". Với người đọc, hoặc với bất kỳ pipeline nào chuẩn hoá và loại bỏ ký tự ẩn trước khi xử lý, chuỗi vẫn hiện ra là funding bình thường. Nhưng với bộ dò khớp chuỗi literal, hoặc regex không tính đến khả năng có mã ẩn xen giữa, chuỗi byte không còn chứa từ khoá liền mạch nữa. Rủi ro lớn hơn nằm ở các mô hình phân loại spam dựa trên ML và NLP: nếu tokenizer tách văn bản thành từ hoặc sub-word, việc chèn một mã ẩn vào giữa có thể khiến từ quen thuộc bị tách thành các token lạ, làm mô hình không còn nhận ra mẫu quen thuộc.

Chi tiết đáng chú ý nhất ở đây không phải bản thân kỹ thuật Unicode, mà là cách nó được tìm ra: một khoản đầu tư vào an toàn AI, cụ thể là bảo vệ khỏi prompt injection trong email, tình cờ bắt được một chiến dịch phishing truyền thống mà nó không hề được thiết kế để săn. Đây là một minh chứng cụ thể cho việc đầu tư vào kiểm tra nội dung cho AI không chỉ phục vụ rủi ro AI, nó mở rộng luôn bề mặt phát hiện cho các mối đe doạ cũ hơn dùng chung cơ chế kỹ thuật.

Về mặt kỹ thuật áp dụng, nguyên tắc chuẩn hoá trước khi so khớp không chỉ có giá trị cho bộ lọc email. Bất kỳ pipeline nào nhận nội dung từ nguồn ngoài rồi đưa vào bước so khớp từ khoá, phân loại, hay đưa thẳng vào một mô hình AI để xử lý, đều nên loại bỏ ký tự ẩn và không hiển thị trước khi tin tưởng nội dung đó. Cùng một lỗ hổng chuẩn hoá vừa làm yếu bộ lọc phishing, vừa mở đường cho prompt injection nếu nội dung email đó sau này được một trợ lý AI đọc lại.

Sơ đồ mô tả

Đây không phải chuỗi thực thi mã độc nhiều tầng, mà là cách một chuỗi ký tự bị thao túng để ba "người đọc" khác nhau, con người, bộ lọc literal, và mô hình ML, nhìn thấy ba phiên bản khác nhau của cùng một từ, cộng với hạ tầng giúp nó tới được hộp thư.

1. Từ khoá gốc: "funding" trong nội dung lure tài chính.

2. Chèn ký tự ẩn (T1027): operator chèn một ký tự TAG SPACE vô hình (U+E0020, thuộc dải Unicode Tags) vào giữa, tạo ra "fun" cộng ký tự ẩn cộng "ding".

3. Ba cách nhìn khác nhau trên cùng một chuỗi: mắt người và giao diện vẫn hiển thị "funding" bình thường vì ký tự ẩn không được font render; bộ lọc so khớp literal hoặc regex thấy chuỗi byte bị gãy nên so khớp từ khoá thất bại; mô hình ML/NLP phân loại spam có thể tách thành các sub-token lạ, làm giảm độ tin cậy phân loại.

4. Hạ tầng phát tán (T1566): khoảng 148 domain tài chính dùng một lần, ghép từ khoảng 28 từ khoá tái sử dụng, gửi qua relay của ActiveCampaign theo pattern envelope em-\d+/acems\d+/emsd\d+.

5. Link trong email: bị ActiveCampaign viết lại để đi qua domain click-tracking riêng của nền tảng (acemlnd[.]com, activehosted[.]com).

6. Kết quả phát hiện: signature của Microsoft bắt được bất thường Unicode, nhưng quan trọng hơn, hơn 99% email trong chiến dịch vẫn bị chặn nhờ các lớp phát hiện khác không phụ thuộc riêng tín hiệu này.

Doanh nghiệp cần triển khai phòng thủ email bằng AI như thế nào?

Để đối phó hiệu quả với các chiến dịch lẩn tránh như ASCII Smuggling và phishing thế hệ mới, doanh nghiệp không thể chỉ dựa vào các cổng bảo mật email (SEG) truyền thống ở tầng mạng. Cần một chiến lược chuyển dịch cụ thể:

1. Nâng cấp lên kiến trúc bảo mật qua API (ICES)

  • Doanh nghiệp nên bổ sung hoặc chuyển dịch sang các giải pháp ICES (Integrated Cloud Email Security) kết nối trực tiếp qua API với Microsoft 365 hoặc Google Workspace.

  • Khác với giải pháp MX-record truyền thống vốn chỉ quét email gửi đến từ ngoài, ICES sử dụng AI để kiểm tra cả luồng email nội bộ (Internal-to-Internal), giúp phát hiện sớm các cuộc tấn công chiếm quyền tài khoản (Account Takeover - ATO) và Business Email Compromise (BEC).

2. Thiết lập quy trình tiền xử lý nghiêm ngặt cho Pipeline dữ liệu

  • Bổ sung quy tắc khử nhiễu (Sanitization Rule) trên toàn bộ hệ thống xử lý nội dung: tự động strip dải U+E0000–U+E007F và các ký tự zero-width trước khi văn bản được đưa tới các engine kiểm tra hoặc mô hình phân loại.

  • Đặc biệt lưu ý với hệ thống Trợ lý AI / Copilot nội bộ: Nếu doanh nghiệp đang triển khai AI để tự động tóm tắt email hay xử lý tài liệu, bắt buộc phải có tầng Input Guardrail. Điều này ngăn chặn kẻ tấn công lợi dụng ASCII Smuggling để thực hiện tấn công Indirect Prompt Injection, âm thầm điều khiển AI doanh nghiệp trích xuất dữ liệu nội bộ.

3. Tự động hóa phản ứng và truy hồi (Automated Clawback & SOAR)

  • Tích hợp cơ chế phát hiện của AI với playbook tự động: Khi AI nhận diện một mẫu email mang đặc trưng Unicode ẩn hoặc hạ tầng gửi đáng ngờ, hệ thống SOAR phải có khả năng tự động truy quét (Search & Purge/Clawback) toàn bộ các bản sao của email đó đang nằm trong hộp thư của tất cả nhân viên chỉ trong vài giây.

IOC & Artifacts

# Content pattern
U+E0000-E007F                       - Dải Unicode Tags, đặc biệt U+E0020 chèn giữa từ khoá tài chính

# Domain gửi tiêu biểu, đợt 9/2/2026 (Microsoft, 148 domain trong ngày)
guardiangrowthfunding[.]com
digitalcapitalboost[.]com
thebusinessloanexpress[.]com
yourlocfunding[.]com
advancefundingboost[.]com

# Domain gửi tiêu biểu, đợt 9/2025 (Fortra, quy mô nhỏ hơn, cùng pattern đặt tên)
capitalguardianboost[.]com
directfundingloc[.]com
uproarfundingsolutions[.]com
directcapitaltree[.]com
directlendingharbor[.]com

# Click-tracking / URL routing
acemlnd[.]com                       - domain click-tracking dùng chung của ActiveCampaign
activehosted[.]com                  - domain click-tracking dùng chung của ActiveCampaign

# Infrastructure pattern
em-<số>.<brand-domain>               - pattern envelope sender (regex: em-\d+\.)
acems<N>[.]com / emsd<N>[.]com       - pool gửi dùng chung, vd emsd4[.]com, s9.acems10[.]com
173.236.20[.]0/24                    - dải mạng chiếm ~92% khối lượng đo được, KHÔNG phải IOC độc lập
                                        (không gian hạ tầng dùng chung hợp pháp, chỉ dùng để khoanh vùng)

Khuyến nghị bổ sung

  • Chuẩn hoá, loại bỏ ký tự Unicode tag-block (U+E0000-U+E007F) và các mã ẩn/zero-width khác khỏi subject và body email trước khi chạy bất kỳ signature, keyword, hay regex nào

  • Hunt theo dấu hiệu hạ tầng: domain gửi ghép từ vocabulary tài chính nhỏ, kết hợp pattern envelope em-\d+ hoặc acems\d+/emsd\d+

  • Xác minh độc lập mọi lời mời vay vốn hoặc hạn mức tín dụng qua kênh chính thức, không qua link trong email

  • Đào tạo nhận diện mẫu ưu đãi vốn khẩn cấp kèm form thu thập dữ liệu doanh nghiệp và mời gọi điện lại

  • Áp dụng cùng bước chuẩn hoá cho mọi pipeline đưa nội dung email hoặc tài liệu ngoài vào hệ thống AI/LLM nội bộ, giảm luôn rủi ro prompt injection

Tài liệu tham khảo

  1. Microsoft Security Research (Noam Kochavi, Sarah Wolstencroft), "ASCII smuggling crosses over from AI prompt injection to phishing evasion" (3/9/2026): https://www.microsoft.com/en-us/security/blog/2026/09/03/ascii-smuggling-crosses-over-from-ai-prompt-injection-to-phishing-evasion/

  2. The Hacker News (Ravie Lakshmanan), "Phishing Campaign Sends Millions of Emails Using Invisible Unicode to Evade Filters" (4/9/2026): https://thehackernews.com/2026/09/phishing-campaign-sends-millions-of.html

  3. Fortra FIRE team, "Attackers exploit ActiveCampaign to Deliver Thousands of AI-generated SBA Phish" (18/9/2025): https://www.fortra.com/blog/attackers-exploit-activecampaign-deliver-thousands-ai-generated-sba-phish

More from this blog

F

FPT IS Security

996 posts

Dedicated to providing insightful articles on cybersecurity threat intelligence, aimed at empowering individuals and organizations to navigate the digital landscape safely.