Kỹ thuật Context Engineering đang thay đổi: Ý nghĩa cho Data Scientist

30 tháng 8, 2026·5 phút đọc

Anthropic vừa công bố những nguyên tắc mới về Context Engineering cho các mô hình Claude thế hệ 5, đánh dấu sự chuyển dịch từ prompt engineering sang quản lý ngữ cảnh toàn diện. Bài viết phân tích các quy tắc này và cách chúng thay đổi quy trình làm việc hàng ngày của data scientist.

Kỹ thuật Context Engineering đang thay đổi: Ý nghĩa cho Data Scientist

Kỹ thuật Context Engineering đang thay đổi: Điều đó có ý nghĩa gì với Data Scientist?

Việc sử dụng các hệ thống AI như Claude mang lại nhiều lợi ích trong công việc lập trình và phân tích dữ liệu, nhưng cũng đặt ra thách thức mới khi các mô hình được huấn luyện theo cách khác biệt so với trước. Anthropic vừa công bố "quy tắc mới của Context Engineering", cho thấy prompt engineering không còn là trung tâm, nhường chỗ cho việc quản lý ngữ cảnh một cách chiến lược.

Các nguyên tắc mới này yêu cầu data scientist chuyển từ cách tiếp cận "nhồi nhét thông tin vào prompt" sang việc xây dựng hệ thống ngữ cảnh tinh gọn, mô-đun hóa và thông minh. Bài viết này sẽ phân tích chi tiết từng quy tắc và cách áp dụng chúng vào công việc thực tế.

Minh họa về quy trình làm việc với AIMinh họa về quy trình làm việc với AI

Context Engineering là gì?

Có hai cách chính để sử dụng các mô hình Anthropic: API CallsClaude Code.

API Calls là quá trình xử lý một lần: văn bản đầu vào được LLM xử lý và tạo ra chuỗi đầu ra. Bạn trả phí dựa trên số token đầu vào và đầu ra. Claude Code hoạt động theo cơ chế agentic - mô hình được gọi qua nhiều API call khác nhau, mỗi call đảm nhiệm một chức năng riêng như lập luận, viết code, tạo đầu ra.

Trong trường hợp API call, prompt engineering - nghệ thuật tạo ra thông tin đầu vào hoàn hảo - là vô cùng quan trọng. Nhưng với agent, prompt engineering ít đóng vai trò trung tâm hơn vì agent được thiết kế để trực quan và dễ sử dụng.

Tuy nhiên, điều này không có nghĩa Claude có thể "đọc được suy nghĩ" của bạn. Tất cả thông tin cần thiết vẫn phải được đặt trong các tài liệu, file hướng dẫn và cài đặt - gọi chung là "context" (ngữ cảnh). Context engineering chính là việc thiết kế và tối ưu hóa các nguồn ngữ cảnh này để agent hoạt động hiệu quả nhất.

Quy tắc 1: "Tin tôi đi" - Giảm thiểu hướng dẫn không cần thiết

Quy tắc đầu tiên xoay quanh file CLAUDE.md - file được tạo tự động khi bạn khởi tạo một thư mục với Claude Code. Anthropic khuyến nghị: hãy ngừng đưa quá nhiều chỉ dẫn và hãy tin tưởng Claude.

Các mô hình mới có khả năng tự lấp đầy khoảng trống thông tin. Việc thêm quá nhiều chỉ dẫn chi tiết không chỉ thừa thãi mà còn tăng xác suất gây ra xung đột giữa các thông tin.

Thay vào đó, bạn có thể viết trong CLAUDE.md rằng thư mục này là thư mục EDA, thư mục nghiên cứu, hay thư mục code production. Claude sẽ tự hiểu cần cẩn trọng hơn khi implement tính năng cho production và sẽ dùng file .py thay vì notebook, trong khi với thư mục EDA thì ngược lại.

Ví dụ về phân cấp kỹ năng (skill tree) cho data scienceVí dụ về phân cấp kỹ năng (skill tree) cho data science

Quy tắc 2: "Không spoil!" - Mô-đun hóa kỹ năng thành cây phân cấp

Claude được thiết kế để sử dụng "skills" - các file chứa hướng dẫn cho những tác vụ lặp đi lặp lại. Anthropic khuyên rằng nếu đặt mọi thứ vào một skill dài, Claude sẽ không biết đâu là thông tin thực sự liên quan.

Với góc nhìn data science, mỗi tác vụ nhỏ như load dữ liệu, khám phá dữ liệu, thiết lập Databricks, huấn luyện mô hình... nên tạo thành một skill riêng. Các skill nhỏ này được gói trong một skill tổng hợp, tạo thành cây phân cấp kỹ năng.

Ví dụ: bạn không nên xây dựng data.md chứa mọi thứ về load, kiểm tra chất lượng và biến đổi dữ liệu. Thay vào đó, data.md sẽ ngắn gọn và chuyển hướng Claude đến skill con phù hợp như loading.md khi cần.

Quy tắc 3: "Cảm ơn vì những ký ức!" - Tận dụng bộ nhớ tự cập nhật

Các mô hình Claude mới rất giỏi ghi nhớ thói quen của bạn. File CLAUDE.md sẽ được cập nhật thường xuyên với thông tin về sở thích làm việc của bạn.

Một mẹo thực tế: khi một skill hoạt động không đúng như mong muốn, hãy yêu cầu Claude cập nhật skill đó để lần sau hoạt động tốt hơn. Ví dụ, nếu preprocessing.md xử lý giá trị thiếu quá mạnh tay (loại bỏ toàn bộ NaN mà không kiểm tra trước), bạn có thể yêu cầu Claude điều chỉnh lại.

Hình ảnh về trí nhớ và học tập của AIHình ảnh về trí nhớ và học tập của AI

Quy tắc 4: "Đừng đánh giá thấp sức mạnh của tôi!" - Sử dụng đa dạng định dạng file

Claude có thể làm việc với nhiều định dạng file khác nhau, không chỉ .py.json. Chẳng hạn, nếu bạn có hyperparameter.json chứa cấu hình tham số huấn luyện, hãy chỉ định trong skill training.md để Claude biết và phân tích khi cần.

Ngoài ra, bạn có thể sử dụng artifacts - các file HTML phong phú, rất hữu ích để trình bày kết quả, review output nội bộ, kiểm thử các phần khác nhau của pipeline và khám phá dữ liệu một cách trực quan.

Kết luận: Tóm tắt nhanh

Thông điệp chính từ bài viết của Anthropic là: khi mô hình thất bại, nguyên nhân thường là do nó đang nhìn vào thông tin sai hoặc thiếu ngữ cảnh. Giải pháp nằm ở context engineering.

Trong thực tế, bạn cần:

  • Tin tưởng Claude điều hướng qua các yêu cầu. Đưa ra hướng dẫn tổng quan nhưng tránh quá chi tiết để ngăn ngừa thông tin mâu thuẫn.
  • Mô-đun hóa kỹ năng thành các routine nhỏ, cụ thể. Điều này giúp ngữ cảnh của Claude luôn tinh gọn và hiệu quả.
  • Tận dụng bộ nhớ tự cập nhật của Claude, hiệu chỉnh skill sau mỗi phiên làm việc.
  • Áp dụng artifacts để tăng cường khả năng trực quan hóa và khám phá dữ liệu.

Mặc dù bài viết tập trung vào Claude, xu hướng này áp dụng cho cả các nhà cung cấp khác. Các mô hình ngày càng thông minh hơn, và context engineering chính là "nhân vật chính" để khai phá toàn bộ tiềm năng của chúng - kể cả khi sử dụng Codex hay các công cụ agentic tương tự.

Chia sẻ:FacebookX
Nội dung tổng hợp bằng AI, mang tính tham khảo. Xem bài gốc ↗