重點摘要
- Llama 3 模型概覽:Meta 的 Llama 3 系列包含 8B 和 70B 兩種規模的先進大型語言模型 (LLM),針對對話任務和文字生成進行最佳化。
- 效能評估:Llama 3 在關鍵基準測試上超越了 Mistral 7B 和 Gemini 1.5 等開源模型,展現出更強大的推理和上下文處理能力。
- API 實用性:API 是開發人員將先進 LLM 高效整合到應用程式中的關鍵連接器,能實現輕鬆擴展和回應自訂。
- 知名 API 提供商:Lepton、Fireworks、Novita AI 和 Together AI 等領先提供商提供穩健且經濟實惠的 AI 解決方案,適用於各種應用。
- 友善的使用流程:Novita AI 為開發人員提供部署 Llama 3 API 的工具和資源,包括實驗沙盒和簡化的金鑰管理系統。
簡介
像 Meta 的 Llama 3 這樣的大型語言模型 (LLM) 已徹底改變自然語言處理,實現了進階互動和更深入的軟體理解。Llama 3 在對話任務和處理複雜語言挑戰方面表現出色。本文將深入探討 Llama 3 的功能、透過 API 進行的整合,以及像 Novita AI 這樣的 API 提供商在無縫部署這些模型中所扮演的角色。
什麼是 Llama 3 模型?
Meta 開發了 Llama 3 系列大型語言模型 (LLM),包含 8B 和 70B 兩種規模的預訓練和指令微調生成式文字模型。這些指令微調模型針對對話任務進行了最佳化,並在關鍵業界基準測試上超越了許多開源聊天模型。此外,Meta 在開發過程中優先考慮了同時最佳化有用性和安全性。
Llama 3 評估
下方列出模型及其在 Open LLM Leaderboard 上的評分。此清單並非詳盡無遺,因此我們鼓勵您探索完整的排行榜。請記住,LLM 排行榜對於評估預訓練模型特別有用,而其他基準測試則側重於對話模型。

如何使用 Llama 3?
此儲存庫包含兩個版本的 Meta-Llama-3–8B:一個設計用於與 transformers 配合使用,另一個則與原始 Llama 3 程式碼庫相容。
與 transformers 一起使用
請參考以下使用 Transformers 的程式碼片段:
import transformers
import torch
model_id = "meta-llama/Meta-Llama-3-8B"
pipeline = transformers.pipeline(
pipeline("Hey how are you doing today?")
與 llama 3 一起使用
請遵循 repository 中的說明。
若要下載原始檢查點,請參閱下方使用 huggingface-cli 的範例指令:
huggingface-cli download meta-llama/Meta-Llama-3-8B --include “original/*” --local-dir Meta-Llama-3-8B
對於 Hugging Face 支援,Meta-Llama 開發人員建議使用 Transformers 或 TGI,但類似的指令也可運作。
Meta 的 LLama 3 是 LLama 2 的兩倍大
Llama 3 具有改進的推理能力,並支援高達 8,000 個 token 的更大上下文視窗,從而增強其在軟體開發中處理複雜自然語言處理任務的效能。Meta 的 Llama 3 在包含超過 15 兆個 token 的龐大資料集上進行訓練。
對比 Mistral 7B 和 Gemma 7B
據稱,Meta 的 Llama 3 8B 模型在 MMLU、ARC 和 DROP 等多項基準測試上勝過 Mistral 7B 和 Gemma 7B 等其他開源模型。
對比 Gemini 1.5
Meta 的 Llama 3 70B 在 MMLU、HumanEval 和 GSM-8K 等多項基準測試上展現出優於 Gemini 1.5 Pro 的效能。
對比 GPT-3.5
Meta 的 Llama 3 70B 在專門設計用於評估編碼、寫作、推理和摘要能力的自訂測試集上,展現出與 GPT-3.5 相媲美的出色效能。
什麼是 API?
API(應用程式程式設計介面)是數位連接器,允許不同的軟體應用程式進行通訊和共享資料。它們充當中介,實現各種程式和系統之間的無縫互動。
API 在我們的日常生活中無所不在——無論您是使用叫車應用程式、進行行動支付,還是遠端控制智慧家庭裝置。當您使用這些應用程式時,它們依賴 API 與伺服器交換資訊、處理請求,並以使用者友善的格式在您的裝置上呈現結果。

為什麼我們需要 LLM API?
API 為開發人員提供標準化介面,以將大型語言模型整合到其應用程式中。這種標準化不僅簡化了開發流程,還能確保存取最新的模型改進。它能夠有效擴展任務規模,並為各種應用選擇合適的 LLM。此外,API 的靈活性允許自訂 LLM 回應以滿足特定要求,從而增強其在不同情境下的適應性和相關性。
2024 年開發人員領先的 LLM API 提供商
API 提供商是具有成本效益的雲端平台,可促進機器學習模型的高效部署。它們透過使用者友善的 API、強大的可擴展性和具競爭力的定價,提供無需基礎設施的先進 AI 存取能力,使各種規模的企業都能使用 AI。在本節中,我們將探討業界一些領先的 API 提供商。
以 Llama 3 70B 模型為例,以下是一些 API 提供商,每個都有不同的效能指標和成本效益。我們將詳細說明每個選項,以協助開發人員做出明智的選擇。

Lepton
Lepton 是一家 API 提供商,也支援最多 8,192 個 token 的輸出。其輸入和輸出成本均為 $0.80,延遲為 0.15 秒,吞吐量為 26.02 t/s。
- 優點: Lepton 擁有極低的延遲,非常適合回應時間至關重要的應用。
- 缺點: 但其吞吐量相對較低,可能不適合需要處理大量資料的應用。
Fireworks
Fireworks 是另一家 API 提供商,能夠處理最多 8,192 個 token 輸出的請求。其輸入和輸出成本均為 $0.90,延遲為 0.24 秒,吞吐量為 142.6 t/s。
- 優點: Fireworks 提供極高的吞吐量,非常適合需要處理大量資料且不過度關心成本的用戶。
- 缺點: 延遲相對較高,且其成本在四家 API 提供商中最高,可能不適合預算緊張的用戶。
Novita AI
Novita AI 是一個支援 AI 抱負的雲端平台,提供整合式 API、無伺服器計算和 GPU 實例。它提供負擔得起的成功工具,幫助用戶免費啟動專案,並有效實現他們的 AI 夢想。
Novita AI 是一家 API 提供商,為處理大量請求提供經濟有效的解決方案,非常適合需要處理大量資料且預算有限的用戶。
- 優點: Novita AI 在處理大量請求時成本較低,非常適合需要大量資料處理且注重預算的用戶。
- 缺點: 與其他提供商相比,Novita AI 的延遲為 1.10 秒,這可能對需要快速回應時間的應用構成挑戰。
Together AI
Together AI 是另一家 API 提供商,能夠處理最多 8,192 個 token 輸出的請求。其輸入和輸出成本均為 $0.792,延遲為 0.36 秒,吞吐量為 47.16 t/s。
- 優點: Together 提供較低的延遲和較高的吞吐量,非常適合需要快速處理請求的應用。
- 缺點: 其成本略高於 Novita AI,對於預算非常緊張的用戶可能需要考慮。
在選擇 API 提供商時,請考慮成本、延遲和吞吐量。Novita AI 非常適合具有大量資料需求且注重預算的專案。Lepton 在低延遲應用中表現出色,而 Fireworks 則以較高的成本和延遲處理大量資料。總體而言,Novita AI 在提供經濟實惠的大規模資料處理方面脫穎而出。
進一步探討 LLM API,Llama 3 API 透過標準化的 API 為開發人員提供先進的語言處理能力。這使得語言功能能夠無縫整合到各種應用程式中,從而增強其互動性和分析功能。了解如何在 Novita AI LLM API 平台上使用 Llama 3 API。
使用 Novita AI 的 LLM API 執行 Meta 的 Llama 3
請仔細遵循這些結構化步驟,在 Novita AI 上使用 Llama 3 API 建構強大的語言處理應用程式。這份詳細指南確保了順暢高效的流程,滿足尋求先進 AI 平台的現代開發人員的期望。
步驟 1: 前往 Novita AI 並登入。
您可以使用 Google 或 GitHub 帳戶登入,這將在您首次登入時為您建立一個新帳戶。
或者,您也可以使用電子郵件地址註冊。

步驟 2: 管理 API 金鑰。
Novita AI 使用 Bearer 認證來驗證 API 存取,需要在請求標頭中包含 API 金鑰,例如:Authorization: Bearer {API Key}。
若要管理您的金鑰,請在設定中導航至「Key Management」。
首次登入時會自動建立一個預設金鑰,您可以點擊「+ Add New Key」來產生額外的金鑰。


步驟 3: 選擇您的模型
Novita AI 提供多種模型,包括多個版本的 Llama。選擇最適合您應用需求的模型,無論是聊天完成、文字生成或是其他任務。

此處是我們為 Llama 3 提供的內容:
- meta-llama/llama-3.1–8b-instruct
- meta-llama/llama-3.1–70b-instruct
- meta-llama/llama-3.1–405b-instruct
- meta-llama/llama-3–8b-instruct
- meta-llama/llama-3–70b-instruct
若要瀏覽可用模型的完整清單,您可以造訪 Novita AI LLM Models List。
步驟 4: 探索 LLM API reference 以了解 Novita AI 提供的可用 API 和模型。

步驟 5: 選擇最符合您需求的模型,然後設定您的開發環境。配置選項,例如內容、角色、名稱和提示,以自訂您的應用程式。

步驟 6: 執行多次測試以驗證 API 是否一致地運作並滿足您的應用程式需求。
在 Novita AI 的 LLM API 上部署 Llama 3 API 之前,您可以先在 LLM Playground 中試用。我們為開發人員提供免費使用額度來體驗該平台。如果您有任何建議,歡迎在 Discord 上分享。現在,讓我引導您完成入門步驟:
步驟 1: 透過導航至「Products」標籤,選擇 Model API 來存取 Playground,並開始探索 LLM API。

步驟 2: 選擇模型,選取最適合您評估需求的 Llama 模型。

步驟 3: 輸入您的提示,將其輸入到輸入欄位中,以從所選模型生成回應。
使用 Python Client 的範例
pip install 'openai>=1.0.0'
Chat Completions API:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
# 獲取 Novita AI API 金鑰,請參閱:https://novita.ai/docs/get-started/quickstart.html#_2-manage-api-key.
api_key="<YOUR Novita AI API Key>",
)
model = "Nous-Hermes-2-Mixtral-8x7B-DPO"
stream = True # or False
max_tokens = 512
chat_completion_res = client.chat.completions.create(
model=model,
messages=[
{
"role": "system",
"content": "Act like you are a helpful assistant.",
},
{
"role": "user",
"content": "Hi there!",
}
],
stream=stream,
max_tokens=max_tokens,
)
if stream:
for chunk in chat_completion_res:
print(chunk.choices[0].delta.content or "", end="")
else:
print(chat_completion_res.choices[0].message.content)
Completions API:
from openai import OpenAI
client = OpenAI(
base_url="https://api.novita.ai/v3/openai",
# 獲取 Novita AI API 金鑰,請參閱:https://docs/get-started/quickstart.html#_2-manage-api-key
api_key="<YOUR Novita AI API Key>",
)
model = "Nous-Hermes-2-Mixtral-8x7B-DPO"
stream = True # or False
max_tokens = 512
completion_res = client.completions.create(
model=model,
prompt="A chat between a curious user and an artificial intelligence assistant.\
You are a cooking assistant.\
Be edgy in your cooking ideas.\
USER: How do I make pasta?\
ASSISTANT: First, boil water. Then, add pasta to the boiling water. Cook for 8-10 minutes or until al dente. Drain and serve!\
USER: How do I make it better?\
ASSISTANT:",
stream=stream,
max_tokens=max_tokens,
)
if stream:
for chunk in completion_res:
print(chunk.choices[0].text or "", end="")
else:
print(completion_res.choices[0].text)
Llama 3 API 定價
透過 Novita AI,您可以輕鬆存取和利用業界領先的開源模型,包括大型語言模型,以及影像、音訊和視訊模型。只需按使用量付費,無固定成本或隱藏費用。選擇最適合您需求的 Novita AI 定價 方案。

結論
Meta 的 Llama 3 模型代表了大型語言模型的一項重大進展,增強了對話和推理能力。透過 API 進行整合,此模型改善了各種應用程式的使用者體驗。Novita AI 是脫穎而出的主要 API 提供商,提供 Llama 3 API 以及有效 AI 開發所需的基本工具。像 Novita AI 這樣的平台在滿足對先進 AI 解決方案日益增長的需求方面至關重要,並使開發人員能夠在該領域進行創新。
常見問題
Llama 3 如何改善應用程式效能?
Llama 3 透過高效的演算法和資源使用來增強應用程式效能,確保更快的計算速度,以達到更好的使用者體驗和營運效率。
Llama 3 API 可以與任何應用程式整合嗎?
Llama 3 API 是 LLM API 的專門版本,為開發人員提供先進的語言處理功能。可能需要進行自訂以達到最佳整合效果。
如何免費存取 Llama 3?
如果您偏好本地設定,像 Ollama 這樣的工具可以協助在您的本機上部署 Llama 3 模型,從而能夠在個人專案中免費使用。
Llama 3.1 與 3 有何不同?
Llama 3.1 在數學和推理能力上優於 Llama 3。例如,在 Meta 的技術部落格中,Llama-3.1 (8B) 在 MATH (0-shot, CoT) 上得分為 73.0,超過了 Llama 3 在 MATH (5-shot) 上的 68.4 分。
原文發佈於 Novita AI
Novita AI 是一個一站式雲端平台,助您實現 AI 抱負。整合式 API、無伺服器、GPU 實例——您所需的經濟高效工具。免除基礎設施,免費開始,讓您的 AI 願景成為現實。
推薦閱讀
