AWS Artificial Intelligence

Amazon SageMaker Inferenceのプレフィックス・アウェア・ルーティングでLLMレイテンシを削減

Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference

外電通信のAI外電既定画像
画像: 外電通信 既定画像

日本語短報

AWS Artificial Intelligenceは9月11日、「Amazon SageMaker Inferenceのプレフィックス・アウェア・ルーティングでLLMレイテンシを削減」を公式フィードで発表しました。公式RSSによると、アマゾンSageMaker Inference は、プレフィックス・アウェア・ルーティング、リクエストを送信するルーティング・ストラテジーを同じインスタンスに共有し、KV キャッシュは暖かさを保ちます。 Llama 3.1 70Bのベンチマークでは、最大77%でP50のタイムツーファーストトークンを削減…。内容は自動翻訳・定型編集されています。詳細や正確な仕様は、リンク先の公式発表をご確認ください。

外電票

配信元
AWS Artificial Intelligence
原文タイトル
Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference
原文著者
Kareem Syed-Mohammed
原文公開日時
AI外電取得日時
AI外電初回生成日時
最終更新日時
タイトル翻訳
日本語訳あり
概要翻訳
日本語概要あり
フォールバック
なし
人間修正
なし
公式発表
原文を確認する

この記事は公式RSSから自動収集し、ローカル翻訳モデルと定型編集で生成しています。翻訳や取得内容の正確性は保証されないため、重要な確認は公式発表を優先してください。

公式原文

↗ Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference